Hcompany 发布全新 NeoMME 模型,这是原生多模态且支持多语言的编码器,能够同时理解视觉与文本信息。它在多语言检索、图像理解等任务上表现亮眼,同时兼顾推理效率,为多模态 AI 落地提供了新选择。
Hcompany 近日介绍了 NeoMME,一个原生多模态(multimodal-native)且面向多语言的编码器。与常见“先训练单模态模型再拼接融合”的做法不同,NeoMME 从一开始就在统一的框架内对文本和图像进行联合学习,让视觉与语言特征在早期就完成交互,从而更高效地形成跨模态表示。
在架构设计上,NeoMME 强调效率优先。它采用轻量且可扩展的网络结构,显著减少参数规模与计算成本,却不会牺牲表现力。无论是图像编码、文本编码,还是图像与文本的跨模态推理,NeoMME 都力求在算力有限的环境下保持稳定表现。
多语言能力是 NeoMME 的另一大看点。它不在仅限英语的语料上训练,而是纳入多种语言的图文数据,适用低资源语言时也能保持较好的迁移效果。这样一来,NeoMME 可以服务更广泛的全球化产品或研究场景,尤其在跨语言图片搜索、多语种视觉问答等任务上具有实用价值。
NeoMME 目前已在 Hugging Face 上开放模型权重与相关资源。研究团队也提供了推理脚本,开发者可以将其接入现有多模态应用,或基于它进行微调。官方建议的使用场景包括零样本图像分类、图文检索、多语言跨模态搜索等。
从现有测试结果看,NeoMME 在多语言视觉问 - 答和跨模态检索基准上达到甚至超过同类主流模型的水平,同时保持更快的推理速度和更低的显存占用。这意味着它对部署环境较为敏感的生产系统尤其友好,有助于把多模态能力带到更多边缘设备或实时服务中。
图片来源:Hcompany / Hugging Face
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断