论文解读、算法突破、架构分析
9 月 2 日,阿里云万有无界和腾讯 WorkBuddy 开放平台同日公测,一个月前 AWS 刚开源 Kiro Crew。表面看是同一条 Agent 赛道的三家玩家在同期落子,实际上他们锚定的是完全不同的入口层——阿里锚组织,腾讯锚设备,AWS 锚代码。理解这个分岔,比比较谁的模型强更重要。
MLC 团队的开源项目 WebLLM 借助 WebGPU 硬件加速,将大语言模型推理直接搬进浏览器,无需服务器,兼容 OpenAI API,支持 Llama 3、Qwen 等主流开源模型。
在 2026 年世界人形机器人运动会上,智元以 18 金 46 牌居榜首,且所有参赛机器人均为量产机,灵犀 X2 拿下 100 米障碍金牌,OmniHand 包揽灵巧手 7/8 项冠军。
亚马逊宣布购物版 Alexa 新增诈骗识别功能,可以根据用户提问判断收到的邮件、短信或电话是否来自亚马逊,系统会与亚马逊历史发送的数十亿条消息进行比对。
开发者 Simon Willison 发现 OpenAI 的 ChatGPT 桌面应用(原名 Codex)在本地缓存目录里打包了完整的 LibreOffice、Python、Node.js 和 git,总占用约 1.7GB。
英伟达 CEO 黄仁勋在北卡罗来纳州 G20 科技峰会上将 AI 比作水电等公用设施,呼吁各国加快建设 AI 基础设施,并为美国推动的《卡罗来纳原则》背书,支持轻监管路线。
Sonos 发布 Sonos 27 操作系统,新增生成式 AI 语音功能 Sonos 27voice 和 MCP 协议支持,并公布第二款头戴耳机和新 Soundbar,公司将自身定位从「音箱公司」重新框架为「音频操作系统」。
俄罗斯初创公司 Mostik 开发了一种方法,让 AI 模型通过权重中的数学值直接交流,无需生成文字输出,将 GLM-5.2(7530 亿参数)与 Qwen-3.5(40 亿参数)融合后,成本降至前者的 1/20,性能居两者中间。
开源工具 zvec-grep(zg)将 ripgrep、BM25 和向量搜索合并为一个本地优先的命令行界面,支持语义检索,并可直接作为 AI 智能体的搜索工具使用。
Pangram 完成 900 万美元融资,其 AI 文本检测系统已接入 Substack,该公司给出「百分比」而非「是/否」判断,今年先后让一本小说遭出版商取消合同、让《纽约时报》专栏受到质疑。
Hugging Face 发布新教程,借助 TRL 强化学习库与 OpenEnv 绘图环境,让代码生成模型根据自然语言提示写出绘画指令,逐步渲染出可编辑的水彩画。核心是让模型在环境中不断试错,而不是直接生成像素图。
中科通量推出全球首款基于 RISC-V 数据流架构的视频 AIGC 芯片 SmarCo GC3。计算跟随数据流动,避免数据搬运开销,200 TOPS 算力配合 128GB 内存,试图绕过视频生成的存储墙瓶颈。
工业AI落地时,海量数据常散落在不同系统,难以被AI直接使用。天谋科技提出多模态时序数据库方案,用OBJECT类型统一管理数值、语音和图像,并通过AI Ready架构与场景化模型,解决数据供给和理解难题。
IBM 研究院把时间序列基础模型接入 Confluent 事件流平台,让数据一到达就能生成预测或异常告警。该集成简化了 AI 推理管线,适用于设备维护、金融监测等场景,也代表基础模型在实时智能领域迈出关键一步。
蚂蚁集团统一宽表系统OmniTable获VLDB 2026工业赛道最佳论文,该成果聚焦大模型训练数据准备这一基础环节。系统已管理超35PB、3050亿条语料,将真实SFT数据准备任务从约14天缩短至2.5天,提速5.6倍。
Product OS 是一个基于 Gemini 和 ADK 2 构建的 AI 产品操作系统,通过多智能体协作,完整走通信号感知、调查、诊断、决策、发布、验证、学习的产品闭环。文章深入解析了架构设计、安全边界和工程实践,并提出了 idea-to-impact time 这一核心指标。
预训练只是基础,决定模型性格的是后训练。SFT、RL、DPO各怀绝技,也各有各的失败法。理解这套“其他栈”,才能让模型真正好用。