前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们

Agent开始“自我进化”:会出题、会反思,还会自己长出新技能

AI 前沿2026年8月23日· 5 分钟阅读0 阅读

静态知识:训练完成那一刻起,模型对世界的认知就被冻结了; 上下文有限:再长的上下文窗口也总有边界,多轮交互终究"断片"; 重复犯错:今天教会它的事,明天还会再犯一遍; 训练贵:每次想让模型

                    <div class="detail-content-box has-mask large">
                        <section data-tool="mdnice编辑器" data-website="https://www.mdnice.com" style="margin-top: 0px;margin-bottom: 0px;margin-left: 0px;margin-right: 0px;padding-top: 0px;padding-bottom: 0px;padding-left: 10px;padding-right: 10px;background-attachment: scroll;background-clip: border-box;background-color: rgba(0, 0, 0, 0);background-image: none;background-origin: padding-box;background-position-x: left;background-position-y: top;background-repeat: no-repeat;background-size: auto;width: auto;font-family: &#039;Helvetica Neue&#039;, Helvetica, &#039;Hiragino Sans GB&#039;, &#039;Microsoft YaHei&#039;, Arial;font-size: 16px;color: rgb(0, 0, 0);line-height: 1.5em;word-spacing: 0em;letter-spacing: 0em;word-break: break-word;overflow-wrap: break-word;text-align: justify;" data-nest-level="2" data-pm-slice="0 0 []"><section style="text-align: center;" nodeleaf="" data-nest-level="3"><img src="https://pic.imgdb.cn/i/034BrSMA4mnKcz650TqBFk.gif" class="rich_pages wxw-img" data-ratio="0.325" data-type="gif" data-w="640" type="block" data-imgfileid="502301126" data-aistatus="1"></section>
  • 静态知识:训练完成那一刻起,模型对世界的认知就被冻结了;
  • 上下文有限:再长的上下文窗口也总有边界,多轮交互终究"断片";
  • 重复犯错:今天教会它的事,明天还会再犯一遍;
  • 训练贵:每次想让模型变强一点,要么 SFT 要么 RL,都得重新跑一遍。
  • 左环——在线服务(用 Skill)
    • 查询重写:把用户原始问题改写成更适合检索的形式
    • 混合技能检索:语义相似度(Embedding)+ 词汇相关性(BM25)双管齐下
    • 技能注入生成:把检索到的技能渲染为外部记忆上下文,注入到提示词里
  • 右环——技能进化循环(更新 Skill)
    • 技能提取:从用户交互信号中抽取可重用的技能候选
    • 候选技能管理:判断该 Add(新增)/ Merge(合并)/ Discard(丢弃)
    • 版本化合并:语义并集更新,保留技能身份并更新版本号
  • Executor Agent(执行者):拿当前 Skill 库去跑任务,把失败案例完整记录下来——失败原因、轨迹、最终错误结果一起留档。这是后面所有进化的"原材料"。
  • Proposer Agent(反思者):扮演"诊断医生"的角色。它读完 Executor 的失败记录后,会先做根因分析(为什么失败?是缺技能?还是技能用错了?),再基于过往的反馈历史决定新建一条 Skill还是修改已有 Skill——例如在金融文档 QA 任务里它会自动总结出 "data extraction validation"(数据抽取校验)这样的可复用技能。
  • SkillBuilder Agent(落地者):把 Proposer 的自然语言提案变成结构化的 Skill 文件夹(含元信息、操作步骤、辅助脚本),并在小样本验证集上跑一轮单元化校验。
  • Retriever:基于 Qwen0.6B Emb 的相似度计算
  • Controller:MLP 结构,接受 RL 训练(注意这是这一类里少见的"有训练"环节)
  • Executor Designer Base LLM:全部冻住

2.4 CoEvoSkills(arXiv: 2604.01687v2)

  • Skill Generator:从执行轨迹里提炼候选 Skill。除了写出 Skill 本身(描述 + 步骤),还要同步生成对应的单元测试(输入样例、期望输出、验证逻辑)。
  • Skill Surrogate Verifier:在一个隔离的 sandbox 环境里跑 Generator 写的 Skill 与单元测试,返回结构化验证反馈(不是简单的 pass/fail,而是带"失败原因"和"建议修改方向"的自然语言反馈)。
  • Co-Evolution Iteration(共进化迭代):Skill 与 Test 同时进化——这跟传统软件开发里"先写测试再写代码"的 TDD 有点像。如果 Skill 多次都过不了 Test,可能是 Test 本身写得不合理;反过来如果 Test 太宽松导致烂 Skill 也进库了,下游评估时就会暴露出来。两者互相牵制,逐步收敛到"高质量 Skill + 高严谨度 Test"的稳态。
  • self-evo(强模型自己用自己的 Skill):Opus 4.6 从 30.6% → 71.1%(+40.5),GPT-5.2 从 29.6% → 69.8%(+40.2);
  • cross-model transfer:把 Opus 4.6 的 Skill 给到弱模型,提升从 +35.4 到 +44.1 不等,但绝对值都明显低于让模型自己 self-evo(如 Mistral Large 3 才到 43.1%)。
  1. 多策略轨迹生成(Multi-Strategy Generation):用不同的"性格"采样 N 条轨迹。论文里给了 5 种典型策略——P-greedy(贪心快出)、P-tests-first(先写测试)、P-linter-aware(关注代码风格)、P-defensive(防御式编程)、P-minimal(最小可行)。同一道题,每种策略得到的轨迹完全不同,犯的错也不同。
  2. 反思修订(Revision):对每条轨迹独立做一遍传统 self-refine——找到执行偏差点,针对性修正。这一步是"纵向"的(深耕单条轨迹)。
  3. 质量过滤(Quality-based Filtering):用一个综合评分函数 Reward(t,T) = α·TaskCompletion(t) + β·ReasoningQuality(t) + γ·Efficiency(t) 给每条轨迹打分,把候选数从 10 条砍到 5 条。这避免了下一步重组时被低质量轨迹"污染"。
  4. 跨轨迹重组(Recombination)⭐核心创新:这一步是 SE-Agent 区别于所有 self-refine 工作的关键。它对剩下的 5 条高分轨迹做两类操作:
  • Crossover(交叉):把"轨迹 A 在步骤 5 的精确定位"嫁接到"轨迹 B 的全面测试覆盖"上,合成出一条原本任何单条策略都达不到的混合轨迹;
  • Transfer(迁移):把"防御式策略里学到的 try-except 异常处理"迁移到"贪心策略里缺失异常处理"的位置;
  • Restructure(重构):识别多条轨迹共有的全局模式(如"所有轨迹都漏掉了 type-safe 比较"),统一抽象后做一次系统级重写。
  • 最终方案选取(Final Solution Selection):从 10 个候选(5 原始 + 5 重组)中选最高分的作为输出。整个流程可以迭代多轮(论文里给的 N=4 时已经收敛),每一轮的结果会再喂给下一轮做新的多策略生成。
  • 角色
    配置
    训练题目来源
    官方数据集训练集:ALFWorld(7,500 条 SFT)、WebShop(2,400 条 SFT)、7 个搜索 QA 数据集
    出题者
    无独立出题者,直接使用数据集
    解题者 Qwen2.5-7B-Instruct ✅ 训练
    (Cold-start SFT → GRPO RL)
    Skill 总结者OpenAI o3 ❌ 不训练
    阶段
    Skill 数量
    目标
    Stage 1
    6 条
    学会调用
    Stage 2
    3 条
    减少依赖
    Stage 3
    0 条
    完全内化
    1. 探索:高温 LLM 广度优先(N_b 步)+ 深度优先探索环境
    2. 合成:从探索轨迹蒸馏 + 用户偏好约束 → 生成任务 g 与参考解
    3. 筛选:词法去重 + 语义相似度 + 可行性验证
    4. 混合(可选):
    • Curriculum Agent (RL):负责出题;reward = 答题 Agent 的不确定性 + 工具使用频率
    • Executor Agent (RL):负责解题;reward = 解题成功率
    • Generator Agent:格式 reward + 合法性 reward(不能有幻觉 tool)+ 难度 reward(不能太难太简单)
    标签:AI大模型

    想了解 AI 如何助力您的企业?

    免费获取企业 AI 成熟度诊断报告,发现转型机会

    置顶文章

    会打字,就能"拍"电影:ScriptTask 开放限量内测
    置顶

    会打字,就能"拍"电影:ScriptTask 开放限量内测

    //

    24小时热榜

    TOP1

    人人都在发 Agent 框架的 2026:真正的壁垒,不在框架本身

    Agent开始“自我进化”:会出题、会反思,还会自己长出新技能
    前途科技前途科技
    服务关于快讯技术商业报告
    前途科技微信公众号

    微信公众号

    扫码关注

    Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
  • Solver Agent:格式 reward + 准确性 reward
    • 出题 Agent:reward = 1 − 答题 Agent 成功率;但成功率为 0 时 reward 也为 0(避免出太难的题)
    • 答题 Agent:reward = 解题成功率
    • 代码:HumanEval、MBPP、LCB
    • 数学:AIME24、AIME25、AMC、MATH-500、Minerva、Olympiad

    4.4 第三类总结:真·不需要训练数据

    登录查看剩余 70% 内容
    TOP2

    Agent开始“自我进化”:会出题、会反思,还会自己长出新技能

    3

    我翻了 DeepSeek Harness 的插件:大多数人忙着装修,聪明人在装大脑

    1小时前
    4

    鹅厂员工都碰到过哪些Token刺客?

    1小时前
    鹅厂员工都碰到过哪些Token刺客?
    5

    有谁会用DeepSeek Harness?

    1小时前
    6

    DeepSeek Harness 进阶全家桶:手机遥控、长期记忆、Codex 与第三方网关,一篇玩透

    1小时前
    DeepSeek Harness 进阶全家桶:手机遥控、长期记忆、Codex 与第三方网关,一篇玩透
    7

    DSH-Desktop-个人用户使用指南

    1小时前
    8

    阿里Qwen3.8-27B疯了:笔记本就能跑,能力却直逼Opus4.6

    1小时前
    热门标签
    大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

    关注公众号

    前途科技微信公众号

    扫码关注,获取最新 AI 资讯

    免费获取 AI 落地指南

    3 步完成企业诊断,获取专属转型建议

    已有 200+ 企业完成诊断