至知创新研究院发布大语言模型IQuest-Q1。该模型采用稀疏MoE架构,总参数320B但每次仅激活15B。除了支持提示词生成交互游戏与求解三体运动方程外,更展现出自我迭代及定位强化学习底层训练Bug的高阶工程能力。
不仅能凭借一段提示词直接构建沉浸式竞速游戏,还能在10万步以内数值求解三体问题的运动方程,甚至能深入强化学习(RL)底层抓出引发训练中断的隐蔽空格错误——至知创新研究院(IQuest Research)近日正式公布了大语言模型 IQuest-Q1。

在标准基准测试中,IQuest-Q1 在仓库级代码生成基准 NL2Repo、网络安全评测 CyberGym、终端操作基准 Terminal-Bench 2.1、长程代码工程任务 DeepSWE v1.1 以及复杂办公场景 JobBench 等测试中,均取得了优异的评测成绩。

架构设计上,IQuest-Q1 采用了 Decoder-only Transformer 主干,并结合了稀疏混合专家(MoE)架构。模型总参数量约为 320B,实际运行时激活参数仅约 15B。稀疏激活策略使得模型在维持大容量表征的同时,能以极高算力效率完成推理和任务分发。
值得注意的是,IQuest-Q1 在训练中实践了自我研发闭环机制。模型深度参与了自身的迭代流程:当模型自主提出的研发与优化方案经研究人员验证通过后,相应的模型更新、训练资产和研究流程便会合入下一轮迭代中。每一阶段积累的数据链路、训练配置、评估脚本与工具链,都会持续沉淀为后续版本可复用的研发资产。

除了基准指标,IQuest-Q1 在实际工程与交付场景中的表现也得到了验证。
场景一:提示词生成完整交互小游戏
面对一个包含200余字自然语言需求的提示词,IQuest-Q1 在数分钟内直接交付了一个可直接运行于移动端的单文件 HTML 游戏。模型不仅完成了渲染逻辑,还自动补齐了不同角色设定、状态血条机制以及结算界面的交互彩蛋,展现了极强的端到端逻辑闭环构建能力。


场景二:排查RL训练中的底层空格Bug
在强化学习训练实操中,研究团队遭遇了 Reward 曲线未按预期上升的停滞故障。研究团队借助 Claude Code CLI 框架,让 IQuest-Q1 介入分析训练日志、落盘轨迹并反向排查代码库。
IQuest-Q1 最终准确定位了症结:在 RL 框架接入 Scaffold 的文本回传与轨迹拼接环节中,推理服务在文本解码时多插入了一个空格。该细微错误破坏了前缀匹配逻辑,导致多轮文本错位、前序多轮代码探索与环境交互失效。在修复这一隐藏 Bug 后,训练曲线恢复了正常上升。


IQuest-Q1 的工程排错与长链条交付能力,源于其团队在模型底座与智能体演化方面的多项积累。
在此之前,IQuest Research 已先后提出了 MuonH 优化、UBio-MolFM 及稀疏权重分解等技术方案。其参与提出的 ModularRSI 自进化框架曾登上 Hugging Face 趋势榜前列,将 AI 智能体在 Terminal-Bench 2.0 和 SWE-Bench Verified 的准确率分别推高至 52.43% 和 76.45%,支持执行经验跨任务、跨模型复用。


从生成可用软件到深入底层系统排查异常,IQuest-Q1 展现了大语言模型在解决长程、高容错率严苛任务上的演进方向。
目前该项目已在 GitHub 代码仓库 与 Hugging Face 页面 开源开放,更多技术细节可参见其 官方博客。

免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断