IBM Research 在 Hugging Face 发布新方法,用 ALTK-Evolve 与 SLDD 的组合压缩上下文工程中的 Token 开销,让大模型用更短提示词达到接近完整上下文的性能,同时保持输出质量,降低推理成本。
上下文工程(Context Engineering)正在成为大模型应用的关键能力。模型能做的事越来越多,但要想让它在特定任务上稳定发挥,往往需要塞入大量上下文,Token 开销因此水涨船高。IBM Research 在 Hugging Face 发表新博客,提出一种更省 Token 的做法,核心是 ALTK-Evolve 与 SLDD 的组合。
ALTK-Evolve 针对的是一个很实际的问题:既要让模型理解复杂指令,又不能为每个任务都填充冗长的上下文。传统思路要么靠人工设计提示词,要么依赖长上下文堆效果,成本高、响应慢。IBM 团队把上下文构建看成一个可以自动优化和压缩的过程,让模型在保留关键行为的前提下,把有效信息浓缩进更少的 Token 里。
SLDD 在中间承担了数据层面的“瘦身”工作。它负责从大量示例中筛选和蒸馏出高质量监督信号,让模型不必看到几百条示例也能学到任务规律。这样一来,提示词可以大幅缩短,推理速度和调用成本也顺带改善。
这套方案的核心卖点是兼容性。它与现有大语言模型 API 可以直接配合,不需要额外微调,也不必改动推理框架。对于生产环境里的 AI 智能体、客服系统、信息抽取等场景,这意味着更低的成本和更快的反馈。更重要的是,它让上下文工程从手工拼接走向自动化,降低了大模型落地的门槛。
当然,省 Token 并不是唯一目标。ALTK-Evolve 更强调压缩过程中的行为一致性:不能为了缩短提示词而牺牲输出质量。IBM Research 在博客中给出的结果显示,它在多个任务上都能用更少的上下文逼近甚至追平完整提示词的效果。
原文链接:Thinking of ACE? We Can Do It with Fewer Tokens
原文链接:Hugging Face
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断