前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/09.17 · 00:00/4 MIN/编译自 一水/2 阅读

云知声发布U2-Flash:以递归自我改进打破性能三角

云知声正式发布基于递归自我改进(RSI)技术的U2-Flash模型。该模型采用稀疏MoE架构,单次仅激活约10B参数,却在生成速度提升2.1倍的同时,在代码与AI智能体基准上全面超越前代主力模型。

递归自我改进(Recursive Self-Improvement, RSI)正在成为AI研发的核心主线。这一理念主张「让模型深度参与自身下一版本的训练与演进」。云知声正式发布 U2-Flash,交出了一份国产大语言模型的 RSI 实践答卷。

在传统产品划分中,Flash 系列多为轻量化、低成本的「平替」选项,往往以牺牲部分复杂推理能力为代价换取更快的响应速度。然而,U2-Flash 打破了这一惯例。该模型不仅生成速度提升 2.1 倍,Agent 任务耗时缩短 35%,Token 消耗减少 20% 至 30%,其基准性能还实现了跨代超越:DeepSWE v1.1 评分从上一代 U2 的 32 分跃升至 64.6 分,TerminalBench 3.0 成绩提升至 9 倍,SWE-Bench Pro 达到 61.6 分。

云知声U2-Flash性能概览

架构设计上,U2-Flash 采用稀疏 MoE 架构,总参数约 266B,单次推理仅激活约 10B(不到总参数的 4%)。这种高「智能密度」使其在代码和 Agent 任务中能够与万亿参数级的大模型正面抗衡。

实际测试表现:代码验收与长文本处理

API 层面,U2-Flash 支持 512K 上下文窗口,同时兼容 OpenAI 和 Anthropic 协议,可无缝接入 Claude Code、Cursor 等开发工具,并提供四档推理思考强度切换。

在代码调试与长文本实操中,该模型表现出了较强的主动探索能力:

  1. 无 Issue 自主排错:在未提供任何具体线索的报销系统仓库中,模型耗时约 7 分钟,准确定位了数据漏算、时区串月导出等 3 项隐藏深层次 Bug,并生成了补丁与测试脚本。
  2. 抗干扰与容错自愈:在人为混入错误启动指令、废弃字段和日志诱导的环境中,模型避开了错误的文档指示,自主逆向出正确的接口契约,补齐了单元测试用例。
  3. 多格式超长上下文整合:面对包含 14 份混合格式(白皮书、会议纪要、合规说明等)的半结构化项目材料,模型在 8 分多钟内提炼出了逻辑统一的发布文档,准确修正了冲突数据,并指出了待核实事项。

长上下文处理任务

驱动进化的后训练闭环

小激活参数实现高智能密度的核心,在于云知声构建的 RSI 后训练(Post-training)机制。该闭环包含三个核心机制:

  • 自主任务生成:解决「训练数据来源」问题。模型根据自身当下的能力边界,动态生成处于难度临界点(即接近突破但尚未解决)的任务。系统已自主构建近 10 万道高质量软件工程类问题。
  • 异步 Agent 强化学习:解决「长步数探索效率」问题。将复杂探索拆解至不同沙盒并发运行,避免同步等待导致的资源闲置,并追溯标记关键行动节点。该架构使单位时间有效训练轨迹产出提升约 60%。
  • 多教师在线策略蒸馏:解决「多任务平衡」问题。由数学、代码、指令遵循等专项教师模型逐 Token 提供高密度反馈,使模型达到同等能力所需的训练步数降低约 55%。

此外,这套系统已延伸至集群层面的自动运维,支持硬件巡检、故障定位与训练任务自愈,使训练系统故障平均恢复时间缩短至人工介入的三分之一左右。

U2-Flash后训练闭环逻辑

RSI 的落地分水岭

当前学术界与工业界对 RSI 的评判标准正逐步明朗。国内相关前沿综述将 RSI 分为 L1 至 L5 等级,U2-Flash 的实践体现出了 L3 阶段的特征:在人工设立的沙盒与安全边界内,模型开始自主决定下一代模型应当学习的数据与任务。

由于高频的数据自生成与验证极其依赖计算底座的循环效率,云知声针对国产主流算力平台对底层算子、分布式调度和推理框架进行了适配,部分应用场景下的吞吐与并发表现已接近主流硬件集群水平。随着后训练闭环的持续运转,大语言模型的迭代范式正在从依赖人工标注的线性增长,向模型自主创造有效经验的复利演进迈进。

标签:MoE大语言模型强化学习

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

//

24小时热榜

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据
TOP1

OpenAI发布对齐失效报告框架,曝光模型偷盗密钥与伪造数据

英王查尔斯召集AI巨头闭门会谈
TOP2

英王查尔斯召集AI巨头闭门会谈

3

华为将发布昇腾960芯片,对标英伟达加速算力破局

18小时前
华为将发布昇腾960芯片,对标英伟达加速算力破局
4

ChatGPT 上线分析套件:量化企业 AI 业务价值与回报

前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
23小时前
ChatGPT 上线分析套件:量化企业 AI 业务价值与回报
5

OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify

1天前
OpenAI推ChatGPT广告新功能:支持赞助智能体与Shopify
6

RTX 5090 公版因序列号褪色遭英伟达拒保,多用户确认同类问题

1天前
RTX 5090 公版因序列号褪色遭英伟达拒保,多用户确认同类问题
7

云知声发布U2-Flash:以递归自我改进打破性能三角

1天前
云知声发布U2-Flash:以递归自我改进打破性能三角
8

LLM 看空者的新论据:物理基准接近饱和,但评估本身是坏的

1天前
LLM 看空者的新论据:物理基准接近饱和,但评估本身是坏的
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断