前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 大模型/10.02 · 12:01/4 MIN/编译自 Hugging Face/1 阅读

ServiceNow发布AutoSynthData:针对企业级智能体的合成数据生成框架

企业在落地 AI 智能体时常受限于垂直业务场景的训练数据匮乏。ServiceNow CoreAI 团队推出 AutoSynthData,利用目标模型失败用例与教师模型成功经验,自动化生成高难度、高保真的训练与验证任务,显著提升智能体微调效果。

企业在落地 AI 智能体时,往往需要模型能够在其特定的业务环境中稳定运行。然而,模型即便具备通用的广泛能力,面对复杂的系统工具链、特定业务规则或动态数据状态时,仍然容易出现工具调用失误、违背业务约束等问题。

解决这些痛点最困难的环节在于:如何将单次失败转化为海量、多样化且可靠的训练数据?这些任务既要贴近真实业务,又必须在环境中切实可行,同时配备能够精准校验执行结果的验证器(Verifier)。

AutoSynthData架构概述

为此,ServiceNow CoreAI 团队开发了 AutoSynthData 框架。该框架结合目标模型的失败点与更强教师模型的成功范例,动态定位模型的能力短板,自动化生成并验证对应的训练任务。随着模型能力的进阶,训练课程还会持续向新的能力边界推进。

什么是高质量的企业级智能体任务?

智能体环境定义了模型可观察和修改的状态、可调用的 API 工具以及动作引发的状态转移。AutoSynthData 将任务形式化为三元组:

task = (系统规范, 用户提示词, 验证器)
  1. 系统规范(System Specification):定义系统指令、环境策略和初始化状态,确保清晰且符合真实业务环境。
  2. 用户任务(Agent-Facing Task):必须同时满足可行性(存在可达解)、真实性(符合真实工作流)和难度适配(落在当前模型未完全掌握但可学习的边界内)。
  3. 验证器(Verifier):负责判定轨迹是否成功,需具备一致性(符合系统规范)、健全性(能拒绝错误和违规轨迹)和完备性(认可不同路径的有效解)。

任务生成流程

从失败分析到任务扩增

AutoSynthData 的核心运作分为四个阶段:

  1. 失败归纳为规范卡:在评估环境中对比目标模型与教师模型,提炼出能力短板,生成脱敏的“能力规范卡”(Capability Specification Cards)。生成器不接触原始提示词或实体,避免数据泄露。
  2. Target 阶段(核心样本生成):基于规范卡并行生成独立的任务候选集,并让强教师模型提供成功的参考执行轨迹,随后进入环境验证与求解器评估。
  3. Multiply 阶段(样本扩展):基于通过验证的核心样本,派生出具备不同实体配置、环境初始状态和提示词表述的新变体,并在受控范围内防止多代漂移。

能力规范卡生成流程

双层质量控制:样本校验与批次复审

生成合理的提示词并不代表数据可用。AutoSynthData 引入了样本级与批次级的双重把关机制:

  • 正向验证(Positive Gate):在真实环境中执行参考轨迹,确认验证器能否正确判定成功。
  • 反向验证(Negative Gate):主动对预期结果进行扰动变异,确保验证器能精准拦截错误行为,避免“放水”。
  • 批评与修复(Critique and Repair):未通过校验的样本交由 Critic 模块诊断原因(如状态不一致、逻辑漏洞),并在有限次数内进行定向修复,无需全量推倒重来。
  • 批次级复审(Batch-Level Review):从全局视角监控任务分布,削减冗余品类,动态将算力调度至覆盖不足的能力维度。

样本级验证与修复循环

实验验证与性能提升

研究团队在 EnterpriseOps Gym 基准(已开源对应数据集)上进行了实测:

  • Hybrid 领域:以 Gemma-4-26B-A4B-it 为目标模型、Qwen3.8-27B 为教师模型。系统在 18 小时内生成 2000 条合成样本。经过监督微调(SFT)后,模型平均 Pass@1 提升了 7.2 个百分点(相对提升 35%),验证器成功率从 63.01% 上升至 68.55%,弥补了目标模型与参考基准之间 59% 的差距。
  • ITSM 领域:采用 DeepSeek-V4.1-Flash 作为教师模型,生成 1994 条样本进行微调,模型的平均 Pass@1 从 18.77% 大幅提升至 27.18%。
标签:ServiceNow合成数据AI 智能体微调大语言模型

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参
置顶

表格预测搬进上下文:NVIDIA Kumo Tabular 不训练不调参

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的
置顶

82亿美元买一份「负载说明书」:AMD 收购 World Labs 的真实标的

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

Hybrid 环境评测结果

AutoSynthData 证明了以环境反馈和模型短板为驱动的合成数据闭环体系在企业级智能体调优中的实用价值。该机制未来还将进一步拓展至强化学习(RL)场景,随着智能体策略的更新持续动态迁移训练边界。

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

//

24小时热榜

加州一CEO涉嫌走私3亿美元NVIDIA芯片被捕
TOP1

加州一CEO涉嫌走私3亿美元NVIDIA芯片被捕

Google 首颗 AI 芯片卫星入轨:TPU 测试太空数据中心
TOP2

Google 首颗 AI 芯片卫星入轨:TPU 测试太空数据中心

3

美法官驳回针对 Google AI 的反垄断诉讼

12小时前
美法官驳回针对 Google AI 的反垄断诉讼
4

智能体管钱,信任从哪来?AI身份协议ALMA解析

12小时前
智能体管钱,信任从哪来?AI身份协议ALMA解析
5

arXiv实行投稿限流:每人每月最多提交2篇,拒稿不退额度

5小时前
arXiv实行投稿限流:每人每月最多提交2篇,拒稿不退额度
6

OpenAI向逾百家机构通报AI智能体越权行为

8小时前
OpenAI向逾百家机构通报AI智能体越权行为
7

特朗普:过度监管或致AI公司破产,支持行业自律

8小时前
特朗普:过度监管或致AI公司破产,支持行业自律
8

彭博曝国资租赁机构资助采购英伟达受限芯片

8小时前
彭博曝国资租赁机构资助采购英伟达受限芯片
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断