蚂蚁百灵正式开源首个金融增强模型Ling-3.0-flash-Fin,并发布FinFIRST评测基准。该模型拥有256K上下文,覆盖检索、估值到研报生成的完整链路,推动金融AI从单点问答走向深度投研协同。

蚂蚁集团百灵团队正式开源其首个金融增强开放模型 Ling-3.0-flash-Fin,并同步发布金融搜索评测基准 FinFIRST。与以往仅解决问答、摘要等单点任务的传统金融大模型不同,Ling-3.0-flash-Fin 聚焦真实金融工作流,推动 AI 从“解答疑问”向“执行任务”演进。
在专业金融领域,撰写一份合格的研报往往需要翻阅年报、财报、监管文件等大量多源资料,严谨比对统计口径与时间节点,再进行估值计算与财务建模。这不仅要求 AI 给出答案,更要求其证明数据来源可信、计算逻辑准确以及结论具备可复核性。
Ling-3.0-flash-Fin 基于 Ling-3.0-flash 底座研发,采用 124B 总参数与 5.1B 激活参数设计,支持 256K 长上下文窗口。模型经由海量金融语料的持续预训练、领域微调以及专业工具调用优化,能够高效应对财务工作簿、长篇研报等复杂文档的处理需求。
在模型架构与定位上,该模型强化了面向长链路 AI 智能体(Agent)的工作能力,使检索、核查、建模与报告生成不再是割裂的步骤,而是贯穿成一套完整的专业分析流程。
Ling-3.0-flash-Fin 重点围绕投资研究场景构筑了四项核心能力:
这四项能力的打通,标志着金融 AI 的技术比拼正由基础问答能力升维至复杂工作流承载力。
为了解决金融智能体评测体系缺失的问题,蚂蚁集团联合中金公司投行团队及 50 余位金融专家共同构建并开源了 FinFIRST(Financial Information Retrieval, Sourcing and Traceability)基准。
FinFIRST 要求模型不仅要答对问题,还必须清晰说明“信源来自何处、数据口径为何、结论如何推导”。该评测集覆盖中国内地、中国香港、美国等核心市场,其中中文占比 60.2%,英文占比 39.8%。评测任务具有高度专业性:80% 以上包含多层级子问题,61.8% 需显式计算,75.6% 依赖智能体自主检索判断。
在 FinFIRST、SpreadsheetBench、Finance Agent 等多项主流基准评测中,Ling-3.0-flash-Fin 的综合表现已超越部分更大尺寸的旗舰模型。
目前,Ling-3.0-flash-Fin 已全面开放模型权重与 API 调用接口,FinFIRST 评测套件也已向业界开源。从对话交互走向深度任务协同,大语言模型正加速融入金融等高门槛产业的核心生产环节。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断