大模型技术演进、开源生态与产业落地
多位独立测试者在盲测平台LMArena上发现疑似谷歌下一代旗舰大模型Gemini 4 Pro的测试检查点。该模型套用轻量模型名称进行匿名测试,推理速度据称翻倍,最大输出达25.6万Token,预计年底前正式发布。
Meta 旗下 AI 智能体 Muse 凭借购物整合与日常任务自动化表现强劲,甚至超越 ChatGPT 登顶美区 iOS 榜首。面对挑战,OpenAI 计划于下周 DevDay 推出代号为“o”的全天候个人助手,直接角逐个人智能体市场。
SpaceXAI 发布 Grok 4.7,主打编程与专业知识工作:CursorBench 4.0 从 40.4% 升至 46.3%,API 价格维持每百万输入 2 美元、输出 6 美元不变。
微软将 Foundry 模型路由器覆盖区域从 2 个扩至 28 个,新增 Claude Opus 4.8 和 GPT-5.6,使用默认配置的团队自动生效——但 API 稳定不等于行为稳定。
一个 Hacker News 短文抛出被中文技术圈忽视的问题:把大模型理解成"更强的 token 预测器",会让你在评测、微调和产品定位上系统性走偏。RLVR 后训练已经把优化目标从模仿改成了达成结果——用错心智模型,代价是每一笔训练投入。
770B 总参、49B 激活、1M 上下文、缓存 0.042 美元/百万 tokens——参数和价格之外,Hy4 preview 更值得看的是它在 InfoQ 三次实测里露出的同一个短板:能把复杂任务做完,却不会回头验收自己交付的东西是不是真能被别人打开。这是 Agent 时代的「最后一公里」,也是这次腾讯把模型直接命名为 preview 的另一层意思。
智谱 8 月 28 日晚开源 GLM-5.3 权重,AA 综合智能指数 60 分,与 Claude Fable 5、GPT-5.6 Sol 同处一档。官方主动挑明:底座与 GLM-5.2 同款,全部提升来自后训练。叠加许可证换到营收阈值型、Ascend NPU 写进主部署栈,这次交卷给中国 AI 产业留下的是一张下一步的路线图。
加州联邦法院撤销了国防部对 Anthropic 的「供应链风险」认定,判定其构成违反第一修正案的非法报复,九个联邦机构据此施加的制裁一并解除。但法院同时确认五角大楼有权不用它的模型——真正的争议,即 AI 供应商能否对买家用途设限,法院没有回答。
Anthropic 宣布大幅扩展对科学家的支持,通过新的 Claude 团队计划向全球科学家提供 10,000 个免费或折扣订阅席位,同时扩大 AI for Science 计划覆盖更多学科,以加速科学发现。
OpenAI将教师版ChatGPT扩展至美国20个州的55个新学区,新增超10万名教育工作者,当前合作已覆盖30个州逾30万教师。同时首推覆盖16州的数据隐私协议,为K-12学校评估AI工具提供统一框架,推动负责任的AI教育规模化落地。
OpenAI 宣布在巴西圣保罗设立本地团队,正式启动商业运营。按周活跃用户计算,巴西是 ChatGPT 全球三大市场之一,每天产生约 2.15 亿条消息;巴西的 OpenAI API 开发者数量也位居全球第二。研究估计,AI 到 2030 年可为巴西经济带来近 1 万亿雷亚尔。
OpenAI 与博科尼大学联合实验发现,使用 ChatGPT 能显著提升学生作业的专业度和逻辑性,而因果推理训练则能激发更多独特想法;两者结合,学生兼得两种优势。该研究提示教育评估需从关注答案转向关注思考。
谷歌DeepMind发布Gemini Omni 1.1 Flash,新增场景扩展、首尾帧控制、360p快速预览与4K超分等功能,让生成式视频更可控、更高效。模型已通过Gemini API开放,开发者现可在Google AI Studio中调用。
Anthropic 启动 500 万美元资助计划,支持独立研究机构开发开源评估工具,衡量 AI 对用户福祉的影响,并发布评估指南。申请截止 9 月 21 日。
OpenAI 推出 Admin 插件,让管理员直接在 ChatGPT Work 和 Codex 中完成工作区分析、设置更新和操作执行,并支持自动化审批流程。该插件遵循现有权限控制,帮助团队安全高效地管理快速成长的工作区。
OpenAI 宣布对其前沿模型 API 客户提供零数据保留承诺,并预览隐私安全处理机制。该机制能在不向 OpenAI 人员暴露内容的情况下识别跨交互的滥用模式,以帮助企业满足日益严格的数据隐私与安全要求。
OpenAI 首款自研推理芯片 Jalapeño 公布初步测试结果,在每瓦性能和延迟上均超越现有系统,支持多款开源模型,计划年底部署。该芯片与模型、软件协同设计,展示了全栈优化的潜力。