arXiv 论文提出 Cache-to-Cache(C2C),让多个大模型不再通过文字交流,而是把一个模型的 KV-Cache 投影并融合进另一个模型。论文称平均准确率比单个模型高 6.4% 到 14.2%,比文本沟通高约 3.1% 到 5.4%,延迟平均快 2.5 倍。
arXiv 上一篇题为《Cache-to-Cache:大语言模型间的直接语义通信》的论文,提出让多个大模型不再靠文字互相“交谈”,而是直接交换内部的 KV-Cache。论文 2025 年 10 月 3 日首次提交,2026 年 3 月 2 日更新到第二版,页面显示提交人为 Tianyu Fu,代码已公开。
多模型系统的思路是让不同大模型各展所长,取得单个模型做不到的效果和效率。摘要指出,现有设计里模型之间靠文本沟通:一个模型要把内部表示转成输出的 token 序列,另一个模型再去读这段文字,这也是目前多模型协作中常见的做法。作者认为这个过程有两个代价:丰富的语义信息在转成文字时会丢失,逐 token 生成文字又带来延迟。
KV-Cache 是模型处理输入时保存下来的中间状态。作者先做了“预言机实验”(oracle experiments),发现在不增加缓存大小的前提下,丰富 KV-Cache 里的语义可以提升回答质量,因此认为 KV-Cache 可以作为模型之间沟通的媒介。
C2C 的具体做法,是用一个神经网络把源模型的 KV-Cache 投影并融合到目标模型的 KV-Cache 里,实现语义的直接传递;另有一个可学习的门控机制,负责挑选哪些目标层适合接收这种缓存通信。整个过程不再生成中间文本,接收信息的一方读到的是对方的内部表示,而不是一段转述。
摘要给出三个数字:C2C 的平均准确率比单个模型高 6.4% 到 14.2%;比文本沟通方式高约 3.1% 到 5.4%;延迟平均加速 2.5 倍。
摘要没有列出测试所用的模型组合和评测基准,上述数字也是论文作者自己报告的结果,要判断适用范围,需要读论文正文并对照公开的代码。摘要描述的是把一个模型的缓存投影并融合进另一个模型,模型之间差异更大时表现如何,同样要到正文里核实。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断