云知声正式发布基于递归自我改进(RSI)技术的U2-Flash模型。该模型采用稀疏MoE架构,单次仅激活约10B参数,却在生成速度提升2.1倍的同时,在代码与AI智能体基准上全面超越前代主力模型。
递归自我改进(Recursive Self-Improvement, RSI)正在成为AI研发的核心主线。这一理念主张「让模型深度参与自身下一版本的训练与演进」。云知声正式发布 U2-Flash,交出了一份国产大语言模型的 RSI 实践答卷。
在传统产品划分中,Flash 系列多为轻量化、低成本的「平替」选项,往往以牺牲部分复杂推理能力为代价换取更快的响应速度。然而,U2-Flash 打破了这一惯例。该模型不仅生成速度提升 2.1 倍,Agent 任务耗时缩短 35%,Token 消耗减少 20% 至 30%,其基准性能还实现了跨代超越:DeepSWE v1.1 评分从上一代 U2 的 32 分跃升至 64.6 分,TerminalBench 3.0 成绩提升至 9 倍,SWE-Bench Pro 达到 61.6 分。

架构设计上,U2-Flash 采用稀疏 MoE 架构,总参数约 266B,单次推理仅激活约 10B(不到总参数的 4%)。这种高「智能密度」使其在代码和 Agent 任务中能够与万亿参数级的大模型正面抗衡。
API 层面,U2-Flash 支持 512K 上下文窗口,同时兼容 OpenAI 和 Anthropic 协议,可无缝接入 Claude Code、Cursor 等开发工具,并提供四档推理思考强度切换。
在代码调试与长文本实操中,该模型表现出了较强的主动探索能力:

小激活参数实现高智能密度的核心,在于云知声构建的 RSI 后训练(Post-training)机制。该闭环包含三个核心机制:
此外,这套系统已延伸至集群层面的自动运维,支持硬件巡检、故障定位与训练任务自愈,使训练系统故障平均恢复时间缩短至人工介入的三分之一左右。

当前学术界与工业界对 RSI 的评判标准正逐步明朗。国内相关前沿综述将 RSI 分为 L1 至 L5 等级,U2-Flash 的实践体现出了 L3 阶段的特征:在人工设立的沙盒与安全边界内,模型开始自主决定下一代模型应当学习的数据与任务。
由于高频的数据自生成与验证极其依赖计算底座的循环效率,云知声针对国产主流算力平台对底层算子、分布式调度和推理框架进行了适配,部分应用场景下的吞吐与并发表现已接近主流硬件集群水平。随着后训练闭环的持续运转,大语言模型的迭代范式正在从依赖人工标注的线性增长,向模型自主创造有效经验的复利演进迈进。
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断