Model ML 的 AI 智能体用 GPT-5.6 Sol 自动完成金融分析的最后一公里,PPT 与 Excel 的可评审交付率大幅提升,token 消耗低于同类模型,已投入生产使用。

金融分析在面向客户或高管之前,团队必须走完一段严苛的"最后一公里":核对证据、搭建并格式化文件、逐项检查数字、将每个结论关联到来源。最终交付的 PowerPoint 或 Excel 必须可编辑,经得起审视。
Model ML 的联合创始人 Arnie 和 Chaz Englander 兄弟在两次成功退出后,开始通过家族办公室进行投资。作为"爱造工具的人",他们顺手写了软件来帮自己处理这些琐碎的收尾工作。这个软件后来长成了 Model ML 的产品。
Model ML 的 AI 智能体帮助金融从业者完成从最初需求到研究、分析,再到成品幻灯片或工作簿的完整流程。核心智能体负责规划工作、选择合适工具、核对证据并执行计算,把每一步路由给最适合的模型——通常就是 GPT-5.6 Sol。其自研文档工具能生成带可追溯来源的原生 PowerPoint 和 Excel 文件。
Chaz Englander(联合创始人兼 CEO)表示:"早期模型能完成分析师的工作,但用户必须把任务拆得很细,明确说明想要什么输出。有了 GPT-5.6 Sol,我们发现智能体的产出已经非常接近最终成品。"
Model ML 通过端到端自动化金融工作流来帮助团队。从简报和源材料出发,智能体能完成研究、建模,直到形成交给客户或交易团队的成品材料。金融从业者在分享前只需核对假设、来源与核心信息。
Model ML 的产品号称"与载体无关":你可以从邮件或 Model ML 应用开始一项任务,之后在 Microsoft Office 插件里继续,无需重新说明背景。
这种连贯性也延伸到成品中。投资委员会汇报用的 PPT,Model ML 能将简报和源材料变成可编辑的 PowerPoint。Excel 任务中,智能体可基于客户模板或空白工作簿,抓取数据、跨多页签建立公式和逻辑,再套用金融格式,生成完整电子表格或财务模型。
在 Model ML 面向金融服务的 AI 评估基准 Composite 中,GPT-5.6 Sol 在一个 Excel 工作流里比 Opus 5 少用了 36% 的 token。
"用户应该专注于判断——例如完善假设或打磨观点——而不是重新搭建分析。" Englander 说。
智能体把工作推到最后一公里,也为团队节省大量时间。一家全球资产管理公司中,原本分析师需要约一小时完成的定制化单页报告,现在只需约五分钟。另一个工作流里,Model ML 智能体一次性处理了包含超过 10 万行数据、数百个文件的虚拟数据室。
Model ML 将 GPT-5.6 Sol 与其他领先模型在多个金融工作流中做了对比。Composite 评测从金融简报出发,经过研究和计算到可编辑的幻灯片或表格,再检查数字、来源、公式、结构以及演示视觉质量。
PowerPoint 评测融入真实工作流,覆盖数百份生成的 deck,并按详细评分规则打分。GPT-5.6 Sol 在 100% 的测试案例中完成了 PowerPoint 工作流(Opus 5 为 76%),并有 43.3% 的案例通过了"专业就绪"门槛(即输出可直接进入实质性评审),而 Opus 5 为 26.7%。在 deck 质量、简报遵循度、层级和一致性上也领先。
| 指标 (PowerPoint) | GPT-5.6 Sol | Opus 5 | Fable 5 |
|---|---|---|---|
| 专业就绪率 | 43.3% | 26.7% | 32.0% |
| 成功产出 .pptx | 100% | 76% | 82% |
| 简报遵循度 | 78.8% | 77.9% | 78.5% |
| 视觉质量 | 77.9% | 79.3% | 78.9% |
| 每个 deck 的 token(越低越好) | 1.10M | 953K | 1.40M |
Excel 方面:
| 指标 (Excel) | GPT-5.6 Sol | Opus 5 | Fable 5 |
|---|---|---|---|
| 关键输出准确率 | 83.3% | 82.8% | 80.6% |
| 全部关键输出正确 | 50.0% | 60.0% | 60.0% |
| 每个工作簿 token(越低越好) | 2.44M | 3.83M | 2.59M |
| 耗时(分钟/工作簿) | 7.0 | 7.5 | 8.4 |
综合来看,Model ML 已有充分证据将 GPT-5.6 Sol 投入生产,包括一些此前由 Opus 4.8 处理的工作流。在 PowerPoint 流程中,GPT-5.6 Sol 在保持有竞争力的 deck 质量的同时,完成率和"可评审"成品率高于 Opus 5 和 Fable 5,token 消耗比 Fable 5 少约 21%。
Englander 说:"能真正用于工作,意味着用户可以直接进入评审环节。数字能追溯到来源,工作簿可以重新计算,幻灯片可编辑。"
PowerPoint 是对 GPT-5.6 Sol 是否够格上场的严格考验。一个 deck 看起来再漂亮,如果数字错误或无法溯源、图表被扁平化、幻灯片需要重新制作才能分享,评审时依然会失败。
Model ML 在自己的智能体框架内运行模型,配合文档创建与编辑工具,让智能体能生成带可编辑图表和表格的幻灯片。整个过程中,原始简报始终保留在上下文中,返回文件前还会逐页做视觉检查。
Model ML 的框架现在为智能体提供可按需加载的工具包:数据集成、文档编辑工具和技能、代码执行环境等。这套方案来自与 OpenAI 的现场交流。双方追踪了智能体如何规划演示、选择工具并保持上下文,再据此优化指令和工具包加载时机。
Model ML 的客户正转向基于浏览器的输出,这些输出与背后的模型和源材料保持连接。平台能生成安全、可交互的输出,可以持续更新,也可以锁定在某一时点。评审者打开投资摘要,点击某个数字背后的财务模型,还能在同一页面上与智能体协作。
Englander 说:"PowerPoint、Excel 和 Word 是为'知识工作靠人工'的世界设计的。AI 已经改变了这个前提,软件本身也即将改变。"
原文链接:OpenAI Blog
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断