Research Memo · 2026-08-04

视觉语言模型市场扫描:OpenRouterHuggingFace 与 GUI Agent 前沿

聚焦三个问题:OpenRouter 上能调用哪些优秀的 VL 模型、HuggingFace 上有哪些值得关注的开源 VL 模型,以及这些模型用于 GUI 自动化(屏幕理解/元素定位/computer-use)的市场现状。三路并行调研,数据截至 2026-08-04。

覆盖 181 个 OpenRouter 视觉模型 覆盖 15+ 个 HuggingFace 开源 VL 家族 覆盖 6 个 GUI grounding benchmark
01GUI grounding 精度上,闭源与开源差距已明显收窄。 ScreenSpot-Pro 榜单上 Claude Opus 4.8(0.879)领先,但开源阵营的 Qwen3.8 Max(0.845)和字节 UI-TARS 系列已逼近,差距缩小到个位数百分点。
02专用 GUI 模型显著优于同规模通用模型。 UI-TARS-1.5-7B 在 ScreenSpot-Pro 上以 7B 参数拿下 61.6 分,远超参数量大得多的通用模型(如 InternVL2.5-78B 仅 11.5 分)——GUI grounding 是"专项训练"而非"堆参数"的战场。
03"独立 agent 浏览器"这条产品路线在 2026 年集体收缩。 Google Project Mariner(2026-05 关停)、OpenAI ChatGPT Atlas(2026-08-09 停止服务)均将能力收回主 App,GUI agent 更可能作为现有产品内置功能存在,而非独立入口。
04评测本身正在"基准饱和": AndroidWorld 上多个模型已超 90%,但更难的长时程基准 OSWorld 2.0(平均 318 次工具调用)上最强系统成功率骤降到 20.6%——短任务高分不能代表真实复杂工作流的可靠性。

01

OpenRouter 上的 VL 模型

数据直接取自 OpenRouter 官方 API(/api/v1/models),338 个模型中 181 个支持图像输入。以下按厂商精选,完整定价随时间变动,建议调用前用 API 复核。

Anthropic Claude computer-use 官方支持

模型 ID上下文Input $/MOutput $/M上架备注
claude-opus-5 / -fast1M$5–10$25–502026-07最新旗舰
claude-sonnet-51M$2$102026-06当前主力级
claude-fable-51M$10$502026-06
claude-opus-4.5200K$5$252025-11GUI 官方标注 "long-horizon computer use"
claude-sonnet-4.51M$3$152025-09GUI OSWorld 61.4%(第三方测评)
claude-haiku-4.5200K$1$52025-10轻量级

全系支持 text+image+file,多图可用,不支持视频。

OpenAI GPT / o 系列

模型 ID上下文Input $/MOutput $/M上架
gpt-5.6-sol / -pro1.05M$5$302026-07
gpt-5.6-terra1.05M$1$62026-07
gpt-5.6-luna1.05M$0.10$0.602026-07
gpt-5.1-codex400K$0.25–1.25$2–102025-11
o3 / o3-pro / o4-mini200K$1.1–20$4.4–802025-04/06
gpt-4.1 / mini / nano1.05M$0.1–2$0.4–82025-04

2026-07 起品牌化为 terra(均衡)/ sol(高智力)/ luna(轻量)三档子系列。

Google Gemini / Gemma

模型 ID上下文Input $/MOutput $/M上架模态
gemini-3.6-flash1.05M$1.5$7.52026-07image+video+audio+file
gemini-3.1-pro-preview1.05M$2$122026-02全模态
gemini-2.5-pro1.05M$1.25$102025-06仍广泛在用
gemma-4-31b-it262K$0 / $0.1$0 / $0.342026-04开源,含 free 档

Qwen 通义千问 开源阵营 GUI grounding 最高分

模型 ID上下文Input $/MOutput $/M
qwen3-vl-235b-a22b-instruct262K$0.21$1.9
qwen3-vl-30b-a3b-instruct262K$0.15$0.6
qwen3-vl-8b-instruct131–262K$0.117$0.455
qwen2.5-vl-72b-instruct128K$0.8$1.0
qwen3.8-max$2$6

Qwen-UI-Agent 技术报告(2026-07-29):Qwen3-VL-8B 在 ScreenSpot / ScreenSpot-Pro / OSWorld-G 上分别达 94.4% / 54.6% / 58.2%,是开源阵营 GUI grounding 代表作。

其他值得关注 GLM · Kimi · UI-TARS · Meta · Mistral

模型 ID提供方上下文Input $/MOutput $/M备注
bytedance/ui-tars-1.5-7b字节跳动128K$0.1$0.2GUI 专用 GUI agent 模型,官方描述"optimized for GUI-based environments"
z-ai/glm-4.5v智谱65K$0.6$1.8106B MoE,面向"multimodal agent applications"
moonshotai/kimi-k3Moonshot1.05M$3$15OSWorld-Verified 84.8 分,仅次于 Claude
meta-llama/llama-4-scoutMeta1.31M$0.1$0.3已迭代 Llama 3.2 Vision 已下架,由 Llama 4 接替
mistralai/mistral-medium-3-5Mistral262K$1.5$7.5已并入 独立 Pixtral 命名已消失,视觉能力并入 Small/Medium 主线
排查结果: OpenRouter 上未检索到 InternVL(OpenGVLab)、DeepSeek-VL 系列(DeepSeek 在架模型均为纯文本)、独立 Pixtral 命名——这几家的视觉能力需去 HuggingFace 或各自 API 获取。

02

HuggingFace 上的开源 VL 模型

Trending 排序被社区二次微调/量化仓库严重污染,本节以官方仓库 + 权威 benchmark + 各实验室技术报告为准。

通用开源 VL 模型

模型参数量发布方发布协议备注
Qwen2.5-VL-7B7B阿里2025-01Apache 2.0933万次/月下载,社区部署最广泛的开源 VLM 之一
Qwen3-VL-235B-A22B235B/22B激活阿里2025-09Apache 2.0旗舰 MoE
InternVL3.5-38B38.4B上海AI实验室2025-08Apache 2.0旗舰 241B-A28B 版本原生支持 GUI 交互
MiniCPM-V 4.58B面壁智能2025-08Apache 2.0OpenCompass 均分 77.0,号称以 8B 超越 Qwen2.5-VL-72B
GLM-4.5V106B/12B激活智谱2025-08MIT42项VL benchmark同规模SOTA,支持屏幕阅读/图标识别
Molmo2-8B8BAllen Institute for AI持续更新Apache 2.0训练数据/权重/代码全量开源
DeepSeek-VL24.5B激活(MoE)DeepSeek2024-12自定义许可
Pixtral-12B-240912BMistral2024-09Apache 2.0128K 上下文
PaliGemma 23B/10B/28BGoogle2024-12Gemma License三档分辨率

GUI / Screen Understanding 专项模型 按 ScreenSpot-Pro 排序

模型参数量发布方ScreenSpot-Pro备注
UI-TARS-1.5-7B7B字节跳动61.6纯截图输入端到端 agent;OSWorld 42.5,AndroidWorld 64.2
V2P-7B7B学术团队52.5专项优化 grounding
OpenCUA-7B7BXLang Lab50.0ScreenSpot-V2 达 92.3%,Aguvis 团队后续作
UI-TARS-72B-DPO72B字节跳动38.1较上一代最高提升 +42.9%(GUI-Odyssey)
OmniParser v2—(解析工具非独立agent)微软39.6YOLOv8+Florence-2,配合任意VLM做屏幕解析,非独立决策模型
Ferret-UI 2~8BAppleScreenSpot 均分 54.0;Lite 版仅 3B 媲美 24 倍参数模型
GUI-Owl-1.52B–235B多档阿里 mPLUGOSWorld 56.5,AndroidWorld 71.6,20+ benchmark开源SOTA
OS-Atlas-Base-7B7BOS-Copilot开源最大跨平台GUI grounding语料,1300万+元素标注
SeeClick / CogAgent9.6B / 8B学术 / 智谱早期代表作,ScreenSpot 均分 47–53%,已明显落后新一代
关键横向对比: 同为 7B 规模,专项训练的 UI-TARS-1.5-7B(61.6)相比通用模型 InternVL2.5-78B(11.5,参数量大 10 倍以上)在 GUI grounding 上有数量级优势——说明这个任务上"训练数据针对性"比"堆参数"更关键。即便如此,截至 2026 年初,顶尖专项模型在 ScreenSpot-Pro 这类专业软件场景下准确率仍普遍低于 70%。

03

GUI Agent 市场发展现状

OSWorld 成功率从 2024-04 的 12% 提升到 2026-06 的 85%(Claude 系),但新一代长时程基准 OSWorld 2.0 上最强系统仅 20.6%——短任务高分与真实工作流可靠性之间仍有巨大落差。

商业闭源方案

Anthropic
Computer Use 于 2024-10 首发。Claude Cowork(2026-01 桌面研究预览 → 2026-07 扩展至 web/移动)是目前最成熟的产品化 GUI agent。ScreenSpot-Pro 上 Claude Opus 4.8 以 0.879 分居首,OSWorld-Verified 上 Anthropic 系模型占前 25 名中的 7 席。2026-04 起 Pro/Max 订阅不再允许驱动第三方 agent 框架,反映算力成本压力正在传导到定价。
OpenAI
Operator(2025-01)在 OSWorld 上仅 32.6%,已于 2025-08-31 下线并入 ChatGPT Agent(复杂网站 87% 成功率)。2026-04 转向 Codex Background Computer Use 做桌面自动化。独立浏览器 ChatGPT Atlas 已宣布 2026-08-09 停止服务,能力收回主 App/Chrome 扩展。GPT-5.2 在 ScreenSpot-Pro 上 0.863 分,排名第二。
Google
Project Mariner 已于 2026-05-04 关停,能力并入 Gemini Agent 及 Chrome auto-browse。ScreenSpot-Pro 上 Gemini 3 Pro 0.727(第6),OSWorld-Verified 上 Gemini 3.6 Flash 83.0(第4)。
字节跳动
UI-TARS-2(2025-09)采用"数据飞轮"+ 多轮 RL + 统一沙盒,是开源社区关注度最高的 GUI agent 系列(GitHub 3万+ star)。自评 Online-Mind2Web 88.2、AndroidWorld 73.3。
阿里
Qwen3-VL 系列 + Mobile-Agent-v3 / GUI-Owl 多智能体框架。商业化 Qwen3.7-Plus(2026-06 GA)定位为 computer-use agent,ScreenSpot-Pro 79.0 分。ScreenSpot-Pro 榜单开源阵营最高分为 Qwen3.8 Max(0.845)。

Benchmark SOTA 速览 跨榜单协议不同,不可直接横向比较

Benchmark头部模型分数说明
ScreenSpot-ProClaude Opus 4.80.879高分辨率专业软件 grounding
ScreenSpot-Pro(开源最高)Qwen3.8 Max0.845
OSWorld-VerifiedClaude Fable 585.0369任务真实环境操作;单一榜单来源,未经官方渠道交叉核实
OSWorld-Verified(第2)Kimi K384.8唯一进入前二的非 Anthropic 模型
OSWorld 2.0(长时程)最强前沿系统20.6%108任务,人类中位耗时1.6h/318次工具调用
AndroidWorld_SRQwen3.5-35B-A3B0.711已现饱和迹象,多模型超90%
WebVoyagerbrowser-use (BU 2.0)89.1%开源浏览器agent框架,YC W25,$17M融资

技术路线

瓶颈


04

面向 GUI 场景的选型参考

按"要不要自己部署"和"精度优先级"两条轴给出的落点建议,非最终结论——具体取舍取决于你的延迟/成本/隐私约束。

闭源 API · 精度优先
Claude Opus 4.8 / Sonnet 4.5

ScreenSpot-Pro / OSWorld-Verified 双料领先,官方原生 Computer Use API,长时程任务稳定性目前公认最好。成本最高,且订阅套餐已限制第三方框架接入,需走 API 计费。

开源自部署 · 专项 GUI
UI-TARS-1.5-7B

7B 参数在 ScreenSpot-Pro 拿到 61.6 分,超过多数更大的通用模型,Apache 2.0 协议,字节跳动持续维护,GitHub 生态最活跃,适合需要本地部署/成本敏感的场景。

开源自部署 · 综合能力
Qwen3-VL 系列

通用能力与 GUI grounding 兼顾(Qwen3-VL-8B 在 ScreenSpot 达 94.4%),配套 Mobile-Agent-v3/GUI-Owl 多智能体框架,MoE 档位选择灵活,适合既要 GUI 能力又要通用视觉理解的场景。

前置感知层 · 搭配任意LLM
OmniParser v2

不是端到端 agent,而是"截图→结构化UI元素"解析层,可配合 GPT-4o/Claude/Qwen2.5-VL 等任意决策模型使用,适合已有 LLM 选型、只想加一层可靠屏幕解析的场景。