聚焦三个问题:OpenRouter 上能调用哪些优秀的 VL 模型、HuggingFace 上有哪些值得关注的开源 VL 模型,以及这些模型用于 GUI 自动化(屏幕理解/元素定位/computer-use)的市场现状。三路并行调研,数据截至 2026-08-04。
数据直接取自 OpenRouter 官方 API(/api/v1/models),338 个模型中 181 个支持图像输入。以下按厂商精选,完整定价随时间变动,建议调用前用 API 复核。
| 模型 ID | 上下文 | Input $/M | Output $/M | 上架 | 备注 |
|---|---|---|---|---|---|
| claude-opus-5 / -fast | 1M | $5–10 | $25–50 | 2026-07 | 最新旗舰 |
| claude-sonnet-5 | 1M | $2 | $10 | 2026-06 | 当前主力级 |
| claude-fable-5 | 1M | $10 | $50 | 2026-06 | — |
| claude-opus-4.5 | 200K | $5 | $25 | 2025-11 | GUI 官方标注 "long-horizon computer use" |
| claude-sonnet-4.5 | 1M | $3 | $15 | 2025-09 | GUI OSWorld 61.4%(第三方测评) |
| claude-haiku-4.5 | 200K | $1 | $5 | 2025-10 | 轻量级 |
全系支持 text+image+file,多图可用,不支持视频。
| 模型 ID | 上下文 | Input $/M | Output $/M | 上架 |
|---|---|---|---|---|
| gpt-5.6-sol / -pro | 1.05M | $5 | $30 | 2026-07 |
| gpt-5.6-terra | 1.05M | $1 | $6 | 2026-07 |
| gpt-5.6-luna | 1.05M | $0.10 | $0.60 | 2026-07 |
| gpt-5.1-codex | 400K | $0.25–1.25 | $2–10 | 2025-11 |
| o3 / o3-pro / o4-mini | 200K | $1.1–20 | $4.4–80 | 2025-04/06 |
| gpt-4.1 / mini / nano | 1.05M | $0.1–2 | $0.4–8 | 2025-04 |
2026-07 起品牌化为 terra(均衡)/ sol(高智力)/ luna(轻量)三档子系列。
| 模型 ID | 上下文 | Input $/M | Output $/M | 上架 | 模态 |
|---|---|---|---|---|---|
| gemini-3.6-flash | 1.05M | $1.5 | $7.5 | 2026-07 | image+video+audio+file |
| gemini-3.1-pro-preview | 1.05M | $2 | $12 | 2026-02 | 全模态 |
| gemini-2.5-pro | 1.05M | $1.25 | $10 | 2025-06 | 仍广泛在用 |
| gemma-4-31b-it | 262K | $0 / $0.1 | $0 / $0.34 | 2026-04 | 开源,含 free 档 |
| 模型 ID | 上下文 | Input $/M | Output $/M |
|---|---|---|---|
| qwen3-vl-235b-a22b-instruct | 262K | $0.21 | $1.9 |
| qwen3-vl-30b-a3b-instruct | 262K | $0.15 | $0.6 |
| qwen3-vl-8b-instruct | 131–262K | $0.117 | $0.455 |
| qwen2.5-vl-72b-instruct | 128K | $0.8 | $1.0 |
| qwen3.8-max | — | $2 | $6 |
Qwen-UI-Agent 技术报告(2026-07-29):Qwen3-VL-8B 在 ScreenSpot / ScreenSpot-Pro / OSWorld-G 上分别达 94.4% / 54.6% / 58.2%,是开源阵营 GUI grounding 代表作。
| 模型 ID | 提供方 | 上下文 | Input $/M | Output $/M | 备注 |
|---|---|---|---|---|---|
| bytedance/ui-tars-1.5-7b | 字节跳动 | 128K | $0.1 | $0.2 | GUI 专用 GUI agent 模型,官方描述"optimized for GUI-based environments" |
| z-ai/glm-4.5v | 智谱 | 65K | $0.6 | $1.8 | 106B MoE,面向"multimodal agent applications" |
| moonshotai/kimi-k3 | Moonshot | 1.05M | $3 | $15 | OSWorld-Verified 84.8 分,仅次于 Claude |
| meta-llama/llama-4-scout | Meta | 1.31M | $0.1 | $0.3 | 已迭代 Llama 3.2 Vision 已下架,由 Llama 4 接替 |
| mistralai/mistral-medium-3-5 | Mistral | 262K | $1.5 | $7.5 | 已并入 独立 Pixtral 命名已消失,视觉能力并入 Small/Medium 主线 |
Trending 排序被社区二次微调/量化仓库严重污染,本节以官方仓库 + 权威 benchmark + 各实验室技术报告为准。
| 模型 | 参数量 | 发布方 | 发布 | 协议 | 备注 |
|---|---|---|---|---|---|
| Qwen2.5-VL-7B | 7B | 阿里 | 2025-01 | Apache 2.0 | 933万次/月下载,社区部署最广泛的开源 VLM 之一 |
| Qwen3-VL-235B-A22B | 235B/22B激活 | 阿里 | 2025-09 | Apache 2.0 | 旗舰 MoE |
| InternVL3.5-38B | 38.4B | 上海AI实验室 | 2025-08 | Apache 2.0 | 旗舰 241B-A28B 版本原生支持 GUI 交互 |
| MiniCPM-V 4.5 | 8B | 面壁智能 | 2025-08 | Apache 2.0 | OpenCompass 均分 77.0,号称以 8B 超越 Qwen2.5-VL-72B |
| GLM-4.5V | 106B/12B激活 | 智谱 | 2025-08 | MIT | 42项VL benchmark同规模SOTA,支持屏幕阅读/图标识别 |
| Molmo2-8B | 8B | Allen Institute for AI | 持续更新 | Apache 2.0 | 训练数据/权重/代码全量开源 |
| DeepSeek-VL2 | 4.5B激活(MoE) | DeepSeek | 2024-12 | 自定义许可 | — |
| Pixtral-12B-2409 | 12B | Mistral | 2024-09 | Apache 2.0 | 128K 上下文 |
| PaliGemma 2 | 3B/10B/28B | 2024-12 | Gemma License | 三档分辨率 |
| 模型 | 参数量 | 发布方 | ScreenSpot-Pro | 备注 |
|---|---|---|---|---|
| UI-TARS-1.5-7B | 7B | 字节跳动 | 61.6 | 纯截图输入端到端 agent;OSWorld 42.5,AndroidWorld 64.2 |
| V2P-7B | 7B | 学术团队 | 52.5 | 专项优化 grounding |
| OpenCUA-7B | 7B | XLang Lab | 50.0 | ScreenSpot-V2 达 92.3%,Aguvis 团队后续作 |
| UI-TARS-72B-DPO | 72B | 字节跳动 | 38.1 | 较上一代最高提升 +42.9%(GUI-Odyssey) |
| OmniParser v2 | —(解析工具非独立agent) | 微软 | 39.6 | YOLOv8+Florence-2,配合任意VLM做屏幕解析,非独立决策模型 |
| Ferret-UI 2 | ~8B | Apple | — | ScreenSpot 均分 54.0;Lite 版仅 3B 媲美 24 倍参数模型 |
| GUI-Owl-1.5 | 2B–235B多档 | 阿里 mPLUG | — | OSWorld 56.5,AndroidWorld 71.6,20+ benchmark开源SOTA |
| OS-Atlas-Base-7B | 7B | OS-Copilot | — | 开源最大跨平台GUI grounding语料,1300万+元素标注 |
| SeeClick / CogAgent | 9.6B / 8B | 学术 / 智谱 | — | 早期代表作,ScreenSpot 均分 47–53%,已明显落后新一代 |
OSWorld 成功率从 2024-04 的 12% 提升到 2026-06 的 85%(Claude 系),但新一代长时程基准 OSWorld 2.0 上最强系统仅 20.6%——短任务高分与真实工作流可靠性之间仍有巨大落差。
| Benchmark | 头部模型 | 分数 | 说明 |
|---|---|---|---|
| ScreenSpot-Pro | Claude Opus 4.8 | 0.879 | 高分辨率专业软件 grounding |
| ScreenSpot-Pro(开源最高) | Qwen3.8 Max | 0.845 | — |
| OSWorld-Verified | Claude Fable 5 | 85.0 | 369任务真实环境操作;单一榜单来源,未经官方渠道交叉核实 |
| OSWorld-Verified(第2) | Kimi K3 | 84.8 | 唯一进入前二的非 Anthropic 模型 |
| OSWorld 2.0(长时程) | 最强前沿系统 | 20.6% | 108任务,人类中位耗时1.6h/318次工具调用 |
| AndroidWorld_SR | Qwen3.5-35B-A3B | 0.711 | 已现饱和迹象,多模型超90% |
| WebVoyager | browser-use (BU 2.0) | 89.1% | 开源浏览器agent框架,YC W25,$17M融资 |
按"要不要自己部署"和"精度优先级"两条轴给出的落点建议,非最终结论——具体取舍取决于你的延迟/成本/隐私约束。
ScreenSpot-Pro / OSWorld-Verified 双料领先,官方原生 Computer Use API,长时程任务稳定性目前公认最好。成本最高,且订阅套餐已限制第三方框架接入,需走 API 计费。
7B 参数在 ScreenSpot-Pro 拿到 61.6 分,超过多数更大的通用模型,Apache 2.0 协议,字节跳动持续维护,GitHub 生态最活跃,适合需要本地部署/成本敏感的场景。
通用能力与 GUI grounding 兼顾(Qwen3-VL-8B 在 ScreenSpot 达 94.4%),配套 Mobile-Agent-v3/GUI-Owl 多智能体框架,MoE 档位选择灵活,适合既要 GUI 能力又要通用视觉理解的场景。
不是端到端 agent,而是"截图→结构化UI元素"解析层,可配合 GPT-4o/Claude/Qwen2.5-VL 等任意决策模型使用,适合已有 LLM 选型、只想加一层可靠屏幕解析的场景。