B站正式推出「AI无限竞技场」,汇聚各分区UP主在真实应用场景中的百大模型测评。首期榜单中,GPT-6 Astra在多项实测中登顶,国产模型在前五中占据三席,开创了去跑分化的社区实测新模式。
9月16日,B站正式上线「AI无限竞技场」,并发布首期大模型实测榜单。
在首期评测中,GPT-6 Astra在10位UP主的实测对抗中拔得头筹,击败GLM-5.3成为拿下榜首次数最多的模型。在前五名榜单中,国产大语言模型表现亮眼,成功占据三席。
与依赖标准学术数据集的传统基准跑分不同,B站「AI无限竞技场」不设固定的测评维度限制。该平台聚合了全站各领域UP主的真实实测内容,涵盖代码生成、逻辑推理、多智能体协作、垂直领域知识等丰富主题。
评测过程中,UP主们将大模型置于真实工作流、实际专业开发或个性化创意脑洞中进行同题PK,直观展现各模型在实用场景下的能力差距。首期入选的模型阵容覆盖了当前主流阵营,包括DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、通义千问、MiniMax等上百个模型实例。


这一竞技场的推出源于B站AI社区生态的高速扩张。数据显示,过去一年内B站AI知识类内容的消费时长同比增长达72%,月均观看AI相关内容的用户规模超过1.9亿。从技术动态解读到模型深度使用,活跃的社区讨论让大量非标准化、重实操的评测内容自然沉淀。
目前,「AI无限竞技场」榜单保持实时动态更新,并持续面向全站创作者开放测评征集。随着更多真实场景测试样本的补充,该平台将为开发者和终端用户探索AI能力边界提供更具实践参考价值的窗口。用户可通过AI无限竞技场查看完整的动态排行榜。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断