静态知识:训练完成那一刻起,模型对世界的认知就被冻结了; 上下文有限:再长的上下文窗口也总有边界,多轮交互终究"断片"; 重复犯错:今天教会它的事,明天还会再犯一遍; 训练贵:每次想让模型
<div class="detail-content-box has-mask large">
<section data-tool="mdnice编辑器" data-website="https://www.mdnice.com" style="margin-top: 0px;margin-bottom: 0px;margin-left: 0px;margin-right: 0px;padding-top: 0px;padding-bottom: 0px;padding-left: 10px;padding-right: 10px;background-attachment: scroll;background-clip: border-box;background-color: rgba(0, 0, 0, 0);background-image: none;background-origin: padding-box;background-position-x: left;background-position-y: top;background-repeat: no-repeat;background-size: auto;width: auto;font-family: 'Helvetica Neue', Helvetica, 'Hiragino Sans GB', 'Microsoft YaHei', Arial;font-size: 16px;color: rgb(0, 0, 0);line-height: 1.5em;word-spacing: 0em;letter-spacing: 0em;word-break: break-word;overflow-wrap: break-word;text-align: justify;" data-nest-level="2" data-pm-slice="0 0 []"><section style="text-align: center;" nodeleaf="" data-nest-level="3"><img src="https://pic.imgdb.cn/i/034BrSMA4mnKcz650TqBFk.gif" class="rich_pages wxw-img" data-ratio="0.325" data-type="gif" data-w="640" type="block" data-imgfileid="502301126" data-aistatus="1"></section>

P-greedy(贪心快出)、P-tests-first(先写测试)、P-linter-aware(关注代码风格)、P-defensive(防御式编程)、P-minimal(最小可行)。同一道题,每种策略得到的轨迹完全不同,犯的错也不同。Reward(t,T) = α·TaskCompletion(t) + β·ReasoningQuality(t) + γ·Efficiency(t) 给每条轨迹打分,把候选数从 10 条砍到 5 条。这避免了下一步重组时被低质量轨迹"污染"。
角色 配置 训练题目来源 官方数据集训练集:ALFWorld(7,500 条 SFT)、WebShop(2,400 条 SFT)、7 个搜索 QA 数据集 出题者 无独立出题者,直接使用数据集 解题者 Qwen2.5-7B-Instruct ✅ 训练 (Cold-start SFT → GRPO RL) Skill 总结者 OpenAI o3 ❌ 不训练
阶段 Skill 数量 目标 Stage 1 6 条 学会调用 Stage 2 3 条 减少依赖 Stage 3 0 条 完全内化
探索:高温 LLM 广度优先(N_b 步)+ 深度优先探索环境 合成:从探索轨迹蒸馏 + 用户偏好约束 → 生成任务 g 与参考解 筛选:词法去重 + 语义相似度 + 可行性验证 混合(可选):
Curriculum Agent (RL):负责出题;reward = 答题 Agent 的不确定性 + 工具使用频率 Executor Agent (RL):负责解题;reward = 解题成功率
Generator Agent:格式 reward + 合法性 reward(不能有幻觉 tool)+ 难度 reward(不能太难太简单)
免费获取企业 AI 成熟度诊断报告,发现转型机会
出题 Agent:reward = 1 − 答题 Agent 成功率;但成功率为 0 时 reward 也为 0(避免出太难的题) 答题 Agent:reward = 解题成功率
代码:HumanEval、MBPP、LCB 数学:AIME24、AIME25、AMC、MATH-500、Minerva、Olympiad 4.4 第三类总结:真·不需要训练数据
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断