科大讯飞发布基于全国产算力训练的语音基座大模型 Spark-Audio-1.0-Preview,直接理解语音而非先转文字,支持 99 种语言和 202 种方言,多项评测超越 Gemini-3.1 Pro。
2026 年 9 月 16 日,科大讯飞宣布 Spark-Audio-1.0-Preview 上线,这是一款基于全国产算力集群训练的语音基座大模型。
传统语音处理方案采用级联架构——先把语音转成文字,再交给语言模型理解。这种做法有两个明显缺陷:文字会丢掉语气、情绪和背景音等非语言信息;多模块串联会累积误差并造成延迟。
Spark-Audio-1.0-Preview 的做法是直接处理原始语音,一次性理解人声、环境音、音乐,并同步解析语义、情绪和场景。官方将此描述为从"听清"走向"听懂"。
Spark-Audio-1.0-Preview 支持 99 种语言和 202 种方言的识别,同时具备语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及复杂音频问答等能力。
评测表现:
与讯飞星火大模型的"1+N"体系相同,Spark-Audio 基座可通过微调衍生出专用模型:语音识别、语音同传、语音交互等均可在此基础上落地。这意味着企业客户可以基于同一底座,定制适配不同场景的专属语音能力。
Spark-Audio-1.0-Preview 目前处于预览阶段,正式版的发布时间和 API 开放计划尚未披露。"全国产算力"这一标签在当前政策环境下具有独立价值——对于有信创要求的客户,这是商业选型的关键因素之一。
免费获取企业 AI 成熟度诊断报告,发现转型机会

关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断