论文解读、算法突破、架构分析
安全机构 Air 披露名为 Plugin4Shell 的高危漏洞,波及 Claude Code、Codex、Copilot 等主流 AI 编程智能体。攻击者可绕过插件校验实现零点击远程代码执行。目前 Anthropic 与 OpenAI 已修复,微软暂未修补。
谷歌近日发布 Gemini 3.8 Live 与 Extended Thinking 两款实时对话模型,解决语音 Agent 执行任务时的"沉默时刻"问题;同期腾讯 WorkBuddy、百度搭子与小度等也在把 Agent 接入硬件设备,触达聊天框之外的现实场景。
Uber 工程团队在官方博客中详解重试风暴的成因:单点故障沿深层调用链被逐跳重试放大,最终演变成全站级事故。除了现有的重试预算机制,Uber 提出用"错误归属"区分症状与病因,让系统判断该由哪个节点重试、哪个节点该放弃,把重试风暴的影响范围限制在故障源附近。文章配图显示,该机制曾在一次重大服务降级事件中拦截950万次多余请求。
编程语言 Bend 通过在代码中声明不可违反的规则(LAWS.bend),并要求 AI 生成对应的数学证明(PROOF.bend)来拦截错误改动;同一份代码可编译为原生程序,单核接近C语言速度,也能跑在16核或GPU上,官网称GPU并行最多比单核快上百倍。项目仍处于早期阶段,官网提示可能存在bug。
近期两篇独立博客文章分别讨论了LLM对写作和编程两种技能的影响:sockpuppet.org提出用LLM当编辑而非代笔的两条规则;blog.ploeh.dk的Mark Seemann则公开回复一位读者关于是否还要系统学编程基础的来信。
第叁范式发布 M3EM Studio 2026 R2,称为国内首款 GPU 原生跨尺度系统级电磁仿真软件,在封装基板、5G 手机整机及智能汽车天线仿真中完成亿级网格验证,关键指标据称与国际主流商业软件结果高度吻合。
AutoBot 是一个开源的自我改进智能体外壳,依托 macOS 上的 ChatGPT 桌面版运行,通过分层记忆和持久任务图让长任务在执行者被替换后仍可接续完成。据 GitHub 项目页披露的基准数据,其在 OSWorld 2.0 上以 32.41% 的二元准确率超过 Claude Opus 5 Max,并在 AssistantBench 官方隐藏测试排行榜上以 50.70% 的准确率排名第一。
在 deepin-ports SIG 协助下,国产操作系统 deepin 25 完成对进迭时空 RISC-V 芯片 K3 的适配,工具链升级至 RVA23 Profile 基线,本地大模型推理任务可自动调度至芯片内置的 8 颗 A100 AI 计算核处理,适配镜像已在 deepin-ports 发布。
斯坦福大学团队在《自然》期刊报道,通过基因编辑让小鼠几乎不发育自身大脑皮层,再植入人体细胞培育的类脑组织,使超过85%的移植小鼠成功整合出以人类细胞为主的皮层。研究人员称,这一模型旨在为精神疾病和神经发育障碍研究提供新工具,行为测试显示小鼠表现基本正常,未见能力增强。
面对圣何塞等地居民和环保团体对用电、用水、噪音的抗议,微软没有放缓数据中心扩张计划,而是推出电价保护、水资源补充、本地就业和职业培训等五项承诺,试图让基础设施建设的经济收益更多留在当地社区。
Zimperium 旗下 zLabs 团队披露新型安卓木马 RatHat,其会将受感染设备界面以 XML 形式发送给一款未公开名称的 AI 助手进行识别,返回坐标与导航指令辅助黑客操作。该木马主要面向中文环境用户,通过诈骗 App 传播,利用无障碍权限窃取金融账户信息、拦截短信并阻止用户卸载。
Google 向第三方 AI Agent 开放 Google Home 生态,支持 MCP 协议的 Agent(包括 Claude、ChatGPT)可接管智能家居设备和历史事件数据,早期访问面向高级订阅用户。
研究发现三值大模型中零权重占比高达 51.5%,新存储格式 BITCOS 利用这一分布将实际存储密度从 1.625 bits 降至 1.485 bits/参数,在 29 个测试模型中的 26 个上优于传统五三进制打包。
研究者用强化学习微调 4B 参数开源模型作数据库查询优化器,在标准 Join Order Benchmark 上生成的查询计划比 PostgreSQL 原生优化器快 81%,验证了 LLM 在可验证推理任务上的优势。
Anthropic 将 Claude Cowork 与普通聊天界面合并为统一的 Claude,同时推出 Claude Docs 和 Claude Slides,用户无须在不同入口之间选择,Pro 和 Max 计划率先上线。
华为监事会主席郭平在与新员工座谈中明确战略方向:ICT 及计算业务的目标是成为『英伟达』——核心在于支持客户在昇腾算力上运行任意大模型,而非自研基座大模型。
科大讯飞发布基于全国产算力训练的语音基座大模型 Spark-Audio-1.0-Preview,直接理解语音而非先转文字,支持 99 种语言和 202 种方言,多项评测超越 Gemini-3.1 Pro。