团队项目全景 · 千问模型使用现状

千问在我们的
生产链路

六条产品线、九个模型槽位——从写开场白读屏定位控件

// 为阿里千问团队来访准备 · 纯技术口径 · 单价与评测数据截至 2026-08-07

QWEN3-235B-A22B-2507 QWEN3-VL ×3 QWEN2.5-VL-72B QWEN3-VL-4B 本地权重 OPENROUTER 统一接入 LANGFUSE 全链路计费
0
条产品线在用千问 Akke / 工作台 / Softie / Vivi / CozyUp / Workflow
0
个千问模型槽位含 1 个本地权重兜底
0
类角色对话 / 分析 / 视觉 / GUI 定位
0×
主力槽换代降本输入价 · 同族新快照
SCROLL / 向下滚动
01
Product Lines · Who We Are

六条产品线,各自在用哪一款

一支小团队同时在跑的六个产品,每条线都落了千问——角色各不相同。

主力 · 体量最大Akke 智能获客

抖音全屋定制获客 SaaS。抓评论、判意向、拟话术,再真机把私信发出去。

chat ×2 通道 · 视觉打标 · GUI 定位

Fly.io 东京门店营销工作台

给门店店长的每日任务台,全 SSR,浏览器零直连数据库。

面客文案 · 活动海报解析

Fly.io + NeonSoftie 生成工作流

AI 图片 / 视频生成工作流与计费。多厂商路由,主模型之外配轻量槽。

轻量任务槽 · 可用性探针

Telegram Mini-AppVivi 梦境社交

Telegram 上的 AI 梦境社交应用,跨会话记忆抽取走独立便宜槽。

对话记忆抽取

Vercel + SupabaseCozyUp 陪伴

AI 角色陪伴应用。千问在这条线上做多模型可用性巡检探针。

状态监控探针

内容产线Workflow 视频复刻

爆款视频解构复刻产线。分镜语义审查靠 VL 批量读图,16 张约 20 秒。

VL 分镜审查 · 需求语义检查
口径

六条线共用一套接入方式:OpenRouter 的 OpenAI 兼容端点,模型槽位全部走环境变量覆盖,代码里只留默认值——换模型不改代码、不发版。

02
Where Qwen Sits · Akke Main Pipeline

千问在主链路的哪两步

以体量最大的 Akke 为例:一条抖音评论变成一条已送达的私信,千问负责其中两棒

采集
判定
起草
触达
Qwen
千问
03写开场白与逐轮回复,人设与跨会话记忆全注入
05VL 读屏定位控件,判断字进没进输入框
其他
模型
02DeepSeek V4 Flash 打购买意向分
代码
与人工
01Cron 入队,worker 签名调评论 API 抓取
04后置清洗、长度钳位、运营审批
06真机/云电脑发送,解包回执验真

// 行色=承担者 · 序号跨行跳=一次交接 · 口径 2026-08-07

为什么判定不给千问

不是质量问题,是形状问题。判定是高频、短、只要一个 JSON 的活,走推理型的便宜槽更划算;而「说人话」这件事我们一直放在千问上——换过三次,每次都换回来。

03
Model Inventory · Nine Slots

在用的九个千问槽位

每一行都是线上真的在跑的槽位,含一个留作一键回滚的上代锚点。

模型 slug角色用在哪挂牌价 in / out · ctx
qwen3-235b-a22b-2507对话生成 Akke 抖音私信 + 企微代聊双通道 · 门店工作台面客文案 · Softie 轻量槽 · Workflow 需求语义检查 0.09 / 0.55 · 262K
qwen3-vl-235b-a22b-instruct视觉理解 视频复刻产线分镜语义审查(主用)0.20 / 0.88 · 262K
qwen3-vl-30b-a3b-instructGUI 定位 云电脑抖音 / 企微读屏定位 · VL 调用兜底档0.13 / 0.52 · 262K
qwen3-vl-32b-instruct视觉理解 门店活动海报解析(图转结构化字段)0.104 / 0.416 · 131K
qwen2.5-vl-72b-instruct视觉理解 微信截图 OCR · 装修效果图空间打标0.25 / 0.75 · 128K
qwen3-30b-a3b-instruct-2507分析抽取 便宜档质检 detector · 影子评分(不碰生产额度)0.048 / 0.193 · 262K
qwen-2.5-7b-instruct分析抽取 Vivi 对话记忆抽取0.10 / 0.20 · 33K
Qwen3-VL-4B(本地权重)视觉理解 断网 / 无 key 兜底,8.3GB 本机跑,单图 8–40 秒零 API 费 · 本地
qwen3-235b-a22b回滚锚点 上一代主力,定价表常驻以便一行 env 回退0.455 / 1.82 · 131K

// 单价单位 USD / 百万 token,取自 OpenRouter 挂牌页,2026-08-07 逐个核验;qwen3-30b-2507 当时处于折扣价

04
Unit Economics

那次把主力槽成本砍掉八成

2026-06-08 把 chat 槽从原版切到 2507 快照:同族、同厂、只换快照。

在用千问槽位的输出单价
USD / 百万 token · 输出侧 · OpenRouter 挂牌 2026-08-07
qwen3-235b-a22b上一代 · 已退役 1.820
qwen3-vl-235b-a22b分镜语义审查 0.880
qwen2.5-vl-72b截图 OCR / 打标 0.750
qwen3-235b-a22b-2507现役主力 chat 0.550
qwen3-vl-30b-a3bGUI 定位 0.520
qwen3-vl-32b海报解析 0.416
qwen3-30b-a3b-2507便宜档 detector 0.193

// 青=现役主力 · 蓝=视觉族 · 琥珀=已退役对照 · 灰=便宜档

输入侧 5.1×

$0.455 → $0.09。评论与人设 prompt 长,输入侧占大头,这一刀最疼。

输出侧 3.3×

$1.82 → $0.55。私信本身短,输出侧省得少,但仍是三分之一。

迁移风险最低

同族快照,人设 prompt 一字未改,无跨厂商的口吻漂移。

一个诚实的补充

这次换代拿到的红利是成本砍掉八成不是效果飞跃。去偏评测里所有候选的自然度都卡在 3.4~3.5 一线——真正的杠杆在 prompt,不在换模型。

05
Bake-offs · Two Rounds, De-biased

选型是怎么定下来的

两轮横评,都走生产代码路径、都换过中立裁判去偏——结论有一个反直觉。

第一轮 · 开场白横评(36 条真实评论 · 高/中/低意向各档)
估算每千条开场白成本 USD · 裁判 glm-4-32b(中立且非推理)· 2026-06-08
qwen3-235b-a22b原默认 · 无杜撰 2.69 ≈ 5.6
deepseek-v4-flash合格备选 · 无杜撰 3.11 ≈ 1.6
qwen3-235b-a22b-2507胜出 · 无杜撰 3.03 ≈ 1.0

// 原默认其实是三者里最贵且杜撰最多的那个 · 分值为 1–5 分制

第二轮 · 企微短对话横评(28 探针 × 3 采样 · 双裁判)
综合均分 0–10 · 裁判 grok-4.5 + minimax-m3(两裁判一致度 6.94 / 6.95)· 2026-07-15
kimi-k2.6当轮第 1 6.94
qwen3-235b-a22b-2507当轮第 4 5.82
qwen3-max当轮末位 4.77

// 五模型参评,中间两名(glm-4.7 / deepseek-v4-pro)分值未留档,此处不列

转折 · 六天后全量回滚

照第二轮结论切了 kimi,07-21 又全量回滚到 2507。原因不在质量分:kimi 是推理模型,我们只传了 effort:low 压不住,每条烧 100~868 reasoning token,单条回复 131~171 秒,击穿中转层 110 秒与客户端 120 秒两道天花板,在用户侧表现为「机器人不回话」。

这件事教会我们的

评测只测了质量、没测 wall-clock 延迟,就会选出一个线上跑不动的冠军。2507 的赢面从来不是分数最高,而是非推理、秒回、话术稳——面客链路上,可预测的延迟本身就是一项能力。

06
Guardrails Around The Model

围着模型建的四道护栏

模型可以换,护栏不能省——这四件事让我们敢在面客链路上灰度。

一行环境变量回滚

抖音与企微两条 chat 通道各有独立 env 键,可分别灰度。上代 slug 常驻定价表,回退不用改代码、不用发版。

推理 token 哨兵

每 15 分钟巡检面客通道的平均 reasoning token,超阈值推红牌告警——专防「有人把非推理槽误切成推理模型」这类静默升级。

评测额度隔离

所有 bake-off 走独立 key,后台设了额度上限,烧超直接 402 停住,碰不到生产额度。这条是被真实事故换来的。

逐条成本回填

网关返回 cost=0,我们用本地定价表把每次调用的成本手动写回 trace,做到按人、按任务、按通道追账。

设计取向

确定性判断交给代码,模糊判断才交给模型——路由、重试、状态码、去重全走代码;分类、起草、摘要、抽取才走模型。能用状态码回答的,不让模型在 prompt 里抖 if-else。

07
What Bit Us · Field Notes

踩过的坑(含反直觉的那个)

这一节写给千问团队看——都是生产实测,不是理论风险。

VISION视觉 · 假阴性重灾区

  • 全屏截图问「回复框里有没有字」,7 条里 5 条字已进框却被判「没进」
  • 问「顶部账号名是不是 X」,人眼确认进对了主页,仍判 false,误杀 6 条
  • 现在的做法:VL 不再当前置门,改用动作的后置结果把关
  • 小目标先按比例裁剪再喂图,成功率从 2/14 拉到 6/6

FORMAT结构化输出

  • 在网关上开 response_format: json_object 会让 Qwen3 输出退化,我们已全线弃用
  • 改成 prompt 内约束 + 后置解析,代价是要自己兜格式
  • few-shot 的标签会漏进正文,得靠正则清洗
  • 2507 长度合规 0.69,低于上一代 0.78——上线后补了长度钳位

COUNTER反直觉的一条

  • 同一轮横评里 qwen3-max(4.77)反而低于 qwen3-235b-a22b(5.82)
  • 场景是中文短对话面客,大号在这类任务上没有兑现规模优势
  • 我们没有继续深挖,凭价格与延迟选了 235b——这正是最想请教的一条
  • 另一类踩最狠的:推理与非推理模型混用,评测口径不同步
Context

以上现象全部基于 OpenRouter 通道的实测。同款模型在 DashScope 官方通道上是否一致,我们没有对照数据——这也是本次交流想确认的第一件事。

08
Open Questions · What We'd Like To Ask

想当面请教的九个问题

按我们卡住的位置排的,越靠前越影响下一步决策

视觉
Q1
GUI 元素定位时,判断「小控件当前是什么状态」的官方推荐姿势是什么?我们的裁剪放大是土办法,有没有专门的 grounding prompt 模板或专用版本?
视觉
Q2
同做 GUI 定位,qwen3-vl-30b-a3b 与 32b 在小目标上的实际差距有多大?我们纯凭价格选了 30B,没做过对照实验。
视觉
Q3
端侧的 Qwen3-VL-4B 我们已在用作断网兜底。它与云端 30B 在 grounding 上的能力断层在哪?有没有更适合端侧读屏的小模型?
格式
Q4
Qwen3 在第三方网关上开 json_object 会退化,DashScope 官方通道是否一致?官方推荐的结构化输出姿势是什么?
选型
Q5
为什么 qwen3-max 在中文短对话面客场景反而低于 235b-a22b?max 的定位场景是什么,什么样的活该给它?
选型
Q6
2507 快照相比原版更少杜撰、但长度控制更松,这是训练取向上的有意取舍吗?后续快照会往哪个方向走?
成本
Q7
主力槽目前走第三方网关。直连 DashScope 在价格、限流、稳定性上有什么差异?对我们东京 / 香港部署的延迟影响有多大?
成本
Q8
我们的人设 prompt 很长且高度重复,目前拿不到 prompt cache,这是成本的大头。官方通道有没有可用的缓存机制与命中条件?
能力
Q9
我们的对话是长期养客——跨会话记忆、几十轮上下文、人设不能崩。Qwen 在超长多轮的人设一致性上,有什么推荐做法或微调路径?

// 玫红=视觉 · 琥珀=格式 · 蓝=选型 · 青=成本 · 紫=能力

一句话总括:我们不是在评估要不要用千问——六条产品线已经全在用了。真正想聊的是怎么用得更对:视觉侧的假阴性怎么治、结构化输出的正确姿势、大号小号的分工边界,以及那条最贵的 prompt cache