Cua 在 GitHub 开源 CUA-S1 系列的首个模型 CUA-S1-FORMS:706,048 个参数、只做表单选项打分,不生成文字;权重在 Hugging Face,代码 MIT 许可,目前是早期研究版本。
Cua 近日在 Hacker News 发布 CUA-S1,并在 GitHub 开源了这一系列的首个模型 CUA-S1-FORMS。它是一个专做「表单决策」的小模型,不是通用的电脑操作大模型。
Cua 是一个开源的电脑操作(computer-use)基础设施项目,包含云端桌面(Fleets)、Apple 芯片上的本地虚拟机(Lume)、跨 macOS / Windows / Linux 的操作驱动 Cua Driver(可通过 CLI、MCP 和 SDK 接入)以及评测工具 Cua Bench。CUA-S1 是其中的模型部分。
项目对 CUA-S1 的定位很克制:它是一族小而专的「系统一」(System 1)模型,“系统一”只是工程类比,指快速、边界清晰的决策,比如某个字段该填哪个值、某个元素该不该动;并不是严格的架构分类,也不取代通用智能体的规划与推理。
首个研究版本聚焦表单:输入是结构化的界面元素和文档里的值,模型给每个选项打分,而不是逐 token 生成回复。动作的先后顺序由应用代码决定,可选的 Cua Driver 集成负责执行,并带有明确的动作边界。
据 Hugging Face 上的模型卡,CUA-S1-FORMS 有 706,048 个可训练参数、检查点 2.8 MB,结构是字节级嵌入加 2 层 Transformer 编码器。它用 10,000 个合成样本训练,模型卡给出的成绩是合成测试集 99.95%,真实演示集 100%——但后者只有 196 个决策。
这些数字都是项目方自己报的。模型卡写明该模型不能凭空生成取值,训练完全基于合成表单,真实数据只有那个 196 个决策的小测试集,标签词汇以英文为主。GitHub 上这一部分是仅含源码的早期研究发布,源码采用 MIT 许可,模型和数据集的具体许可以各自的卡片为准。
CUA-S1 是一个“族”,表单只是第一个方向。其他类型的界面决策会不会出同类模型、真实网页上的表现如何,目前都没有公开数据,需要第三方复现后才有参照。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断