前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

全部资讯

AI 行业最新资讯、产品、技术、商业、洞察

全部产品技术商业洞察政策初创
你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半
09.16/苏晚/12 MIN

你的 Agent 一次跑对下次还行吗:Pass^k 把一致性差距砍到一半

同一个 Agent、同一段 prompt、温度设成 0,跑五次却只有三次成功——这不是采样噪声,是概率分布本身在托管端每天都有微小漂移。IBM Research 把这段被平均值掩盖掉的落差正式命名为 consistency gap,配一套只需一条轨迹的离线诊断和一次性 guideline 注入,Pass^5 从 53% 抬到 69% 而 Mean@5 一分不掉。

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄
09.15/苏晚/5 MIN

混沌工程从支付带到 AI Agent:三个假设需要改写,四条纪律可以直接抄

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束
09.12/苏晚/12 MIN

拆解快手柯南 AI:Claude Agent SDK 之上的四条稳定性硬约束

09.11

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案

用 Gradio Workflow 重建 AUTOMATIC1111:73 节点工程化答案
09.10

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型

IBM 开源 Granite PatchTST-FM-r2:可商用零样本第一的时序基础模型
09.09

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半

拒绝率清零,代价是拒掉 74% 的正常问题:安全对齐评测漏掉的另一半
09.08

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半

拆解 Claude 文本水印:不是绿名单,是锦标赛采样,以及它在中国合规里挡得住的那一半
09.07

NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB

NeoMME 拆解:单塔多模态编码器如何把视觉 RAG 索引压到每页 6 KB
09.06

350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%

350M 模型 100 步 GRPO 微调:结构化输出合规率从 22.6% 抬到 29.7%
「Next-token predictor」是错的心智模型:为什么它决定了你怎么用大模型
AI 大模型/09.05

「Next-token predictor」是错的心智模型:为什么它决定了你怎么用大模型

一个 Hacker News 短文抛出被中文技术圈忽视的问题:把大模型理解成"更强的 token 预测器",会让你在评测、微调和产品定位上系统性走偏。RLVR 后训练已经把优化目标从模仿改成了达成结果——用错心智模型,代价是每一笔训练投入。

NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页
教程/09.04

NeoMME:单塔 Transformer 取代 VLM+投影+解码器,索引缩到 6KB/页

Hugging Face H Company 于 9 月 3 日发布 NeoMME:260M/800M 参数的多模态编码器,从零训练单一双向 Transformer,不用视觉塔与因果解码器,检索质量与 3.75B 模型持平,索引可压到 6KB/页保留 95% nDCG@10。

编码 Agent 更靠谱的 5 层护栏:Cole Medin 11 条清单的落地版
教程/09.03

编码 Agent 更靠谱的 5 层护栏:Cole Medin 11 条清单的落地版

17 分钟视频里的 11 条建议其实是 5 层护栏:上下文管理、事件级保障、会话卫生、并发与迭代硬边界、独立评审。附可以直接抄的钩子配置、交接文模板、规则审计 prompt 和评审 Agent prompt。

Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路
技术/09.03

Agent OS 的三种入口:为什么阿里、腾讯、AWS 押了三条不同的路

9 月 2 日,阿里云万有无界和腾讯 WorkBuddy 开放平台同日公测,一个月前 AWS 刚开源 Kiro Crew。表面看是同一条 Agent 赛道的三家玩家在同期落子,实际上他们锚定的是完全不同的入口层——阿里锚组织,腾讯锚设备,AWS 锚代码。理解这个分岔,比比较谁的模型强更重要。

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路
智能终端/09.02

特努斯上任第一天:苹果悄悄放弃了自研大模型这条路

库克交棒当天,彭博社披露了三个被早报忽略的细节:Siri 付费用 Google Gemini、新 AirPods 摄像头不保存视频、无 AR 智能眼镜取代 Vision Pro。合在一起,这是一次战略换轨——苹果从想做「AI 的操作系统」退回到「AI 时代的硬件公司」。

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来
政策/09.01

Instagram 给 AI 人设降权:Meta 划出的这条治理线,恰好和国内做法反着来

Instagram 把「AI creator」标签改名为「AI-generated profile」,只针对 AI 生成的人设账号——不标就在 Reels/Explore 里对非粉丝限流。真人博主用 AI 生产内容不受影响。这条边界与国内 2025 年 9 月生效的全域「AI 标识办法」几乎相反:一个治「身份」,一个治「内容」。

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程
教程/09.01

Uber 智能体请求涨 9.4 倍、账单没涨:拆开看,这不是省钱教程,是治理教程

Uber 工程部门 8 月 27 日的 AI 软件工厂复盘被普遍读成"如何用便宜模型省钱",但真正的杠杆不在 Sonnet 换 Opus,而在把成本读数装到 statusline 上、把 16 类反模式装到会话仪表盘上——省钱只是这套装表操作的滞后指标。国内团队常犯的错,是省略装表这一步。

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」
法律/08.30

索尼华纳起诉 Anthropic:这次赌的不是「AI 训练是否合法」

8 月 29 日,索尼音乐版权和华纳查普尔在美国加州北区联邦法院向 Anthropic 及其两位联合创始人 Dario Amodei、Benjamin Mann 提起诉讼。今天真正值得看的并不是「AI 训练能不能用版权作品」——那道边界早在 6 月的 Bartz 案 15 亿判决里被钉死了。这份诉状把火力集中在三个更硬的新维度:获取路径的盗版性质、CMI 剥离的独立叠加赔偿、以及创始人作为个人被告的连带责任。

腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent
AI 大模型/08.30

腾讯 Hy4 preview:一个能做完项目却不会自己验收的 Agent

770B 总参、49B 激活、1M 上下文、缓存 0.042 美元/百万 tokens——参数和价格之外,Hy4 preview 更值得看的是它在 InfoQ 三次实测里露出的同一个短板:能把复杂任务做完,却不会回头验收自己交付的东西是不是真能被别人打开。这是 Agent 时代的「最后一公里」,也是这次腾讯把模型直接命名为 preview 的另一层意思。

Open ASR 首次收录印地语:Monsoon 给中文语料的三条硬提示
教程/08.30

Open ASR 首次收录印地语:Monsoon 给中文语料的三条硬提示

Hugging Face 把印度英语和印地语纳入 Open ASR Leaderboard,Monsoon 数据集 4888 名发言人来自 428 个县、315 到 582 款手机、六大方言区都有配额。真正值得抄的不是「多加一门语言」,而是它把评测集从「录了多少小时」翻译成「覆盖多少人」的那套方法——中文 ASR 评测欠的正是这一环。

Agent 不是替你干活,是给你派活
教程/08.29

Agent 不是替你干活,是给你派活

Nate B. Jones 用 OpenRouter 与 OpenAI 的公开数据推翻了一个默认假设:Agent token 用量半年涨 14 倍、每消耗 5 个 Agent token 人类才消耗 1 个,而检查产出的仍然是人。真正在变的不是工作量,是工作的种类——从执行,变成决定什么该被执行、以及检查它做没做对。

GLM-5.3 交卷:中国大模型的下一战,藏在"不加参数"里
AI 大模型/08.29

GLM-5.3 交卷:中国大模型的下一战,藏在"不加参数"里

智谱 8 月 28 日晚开源 GLM-5.3 权重,AA 综合智能指数 60 分,与 Claude Fable 5、GPT-5.6 Sol 同处一档。官方主动挑明:底座与 GLM-5.2 同款,全部提升来自后训练。叠加许可证换到营收阈值型、Ascend NPU 写进主部署栈,这次交卷给中国 AI 产业留下的是一张下一步的路线图。

别被机械臂骗了:Anthropic 押的是硬件驱动标准,不是「Claude 接管物理世界」
具身智能/08.28

别被机械臂骗了:Anthropic 押的是硬件驱动标准,不是「Claude 接管物理世界」

MHS 被媒体讲成了「AI 接管物理世界」的高光时刻,但真正被 Anthropic 放到台面上的是一件更小、也更长期的事——把散落在硬件驱动层的碎片翻译成 Agent 能识别的统一接口。这是协议之战,不是能力奇迹。理解这条边界,中国的机器人、实验室仪器和硬件厂商才知道该关心什么。

Anthropic 打赢那份 59 页判决:被漏掉的角度是政府自己
政策/08.28

Anthropic 打赢那份 59 页判决:被漏掉的角度是政府自己

多数报道停在"AI 公司告赢特朗普政府"。但 59 页判决里最锋利的一刀不是第一修正案,而是政府一边把 Anthropic 定为国家安全威胁、一边还在跟它谈下一代模型合作——这个自我矛盾才是抽掉五角大楼立场的那把刀。对国内 AI 从业者,这个案子更值得看的是三条边界:划红线要付多少代价、被以国家安全之名针对如何自救、AI 军工合同授权范围正在被谁重写。

Anthropic 赢了五角大楼,但「用途谁说了算」仍然悬着
AI 大模型/08.28

Anthropic 赢了五角大楼,但「用途谁说了算」仍然悬着

加州联邦法院撤销了国防部对 Anthropic 的「供应链风险」认定,判定其构成违反第一修正案的非法报复,九个联邦机构据此施加的制裁一并解除。但法院同时确认五角大楼有权不用它的模型——真正的争议,即 AI 供应商能否对买家用途设限,法院没有回答。

具身智能的估值锚点正在换:从讲故事,到看交付
具身智能/08.28

具身智能的估值锚点正在换:从讲故事,到看交付

2026 年一季度国内具身智能融资超 50 起、约 200 亿元,同比增长近 60%。但比金额更值得注意的是资本的问题变了——从「你的模型有多通用」变成「你今年能交付多少台」。

//

24小时热榜

AI短剧红利见顶,字节Seedance降价迎战MiniMax
TOP1

AI短剧红利见顶,字节Seedance降价迎战MiniMax

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者
TOP2

英美荷联手曝光伊朗间谍软件:专盯异见人士与记者

3

12分钟跑完5亿元地产投资模型:Claude 颠覆了什么

14小时前
12分钟跑完5亿元地产投资模型:Claude 颠覆了什么
4

别等想清楚再动手:用AI拆解庞大任务的“最小第一步”

14小时前
别等想清楚再动手:用AI拆解庞大任务的“最小第一步”
5

AI竞争的终局不是做大模型,而是争夺基建与权力

14小时前
AI竞争的终局不是做大模型,而是争夺基建与权力
6

AI在狂飙,但人类习惯走得很慢

14小时前
AI在狂飙,但人类习惯走得很慢
7

逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时

14小时前
逃去超市当收银员后,我算出了自己被机器人淘汰的倒计时
8

软件正在吃掉自己:当所有专业都被冠上“产品”前缀

14小时前
软件正在吃掉自己:当所有专业都被冠上“产品”前缀
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款