主力 · 体量最大Akke 智能获客
抖音全屋定制获客 SaaS。抓评论、判意向、拟话术,再真机把私信发出去。
chat ×2 通道 · 视觉打标 · GUI 定位六条产品线、九个模型槽位——从写开场白到读屏定位控件。
// 为阿里千问团队来访准备 · 纯技术口径 · 单价与评测数据截至 2026-08-07
一支小团队同时在跑的六个产品,每条线都落了千问——角色各不相同。
抖音全屋定制获客 SaaS。抓评论、判意向、拟话术,再真机把私信发出去。
chat ×2 通道 · 视觉打标 · GUI 定位给门店店长的每日任务台,全 SSR,浏览器零直连数据库。
面客文案 · 活动海报解析AI 图片 / 视频生成工作流与计费。多厂商路由,主模型之外配轻量槽。
轻量任务槽 · 可用性探针Telegram 上的 AI 梦境社交应用,跨会话记忆抽取走独立便宜槽。
对话记忆抽取AI 角色陪伴应用。千问在这条线上做多模型可用性巡检探针。
状态监控探针爆款视频解构复刻产线。分镜语义审查靠 VL 批量读图,16 张约 20 秒。
VL 分镜审查 · 需求语义检查六条线共用一套接入方式:OpenRouter 的 OpenAI 兼容端点,模型槽位全部走环境变量覆盖,代码里只留默认值——换模型不改代码、不发版。
以体量最大的 Akke 为例:一条抖音评论变成一条已送达的私信,千问负责其中两棒。
// 行色=承担者 · 序号跨行跳=一次交接 · 口径 2026-08-07
不是质量问题,是形状问题。判定是高频、短、只要一个 JSON 的活,走推理型的便宜槽更划算;而「说人话」这件事我们一直放在千问上——换过三次,每次都换回来。
每一行都是线上真的在跑的槽位,含一个留作一键回滚的上代锚点。
| 模型 slug | 角色 | 用在哪 | 挂牌价 in / out · ctx |
|---|---|---|---|
| qwen3-235b-a22b-2507 | 对话生成 | Akke 抖音私信 + 企微代聊双通道 · 门店工作台面客文案 · Softie 轻量槽 · Workflow 需求语义检查 | 0.09 / 0.55 · 262K |
| qwen3-vl-235b-a22b-instruct | 视觉理解 | 视频复刻产线分镜语义审查(主用) | 0.20 / 0.88 · 262K |
| qwen3-vl-30b-a3b-instruct | GUI 定位 | 云电脑抖音 / 企微读屏定位 · VL 调用兜底档 | 0.13 / 0.52 · 262K |
| qwen3-vl-32b-instruct | 视觉理解 | 门店活动海报解析(图转结构化字段) | 0.104 / 0.416 · 131K |
| qwen2.5-vl-72b-instruct | 视觉理解 | 微信截图 OCR · 装修效果图空间打标 | 0.25 / 0.75 · 128K |
| qwen3-30b-a3b-instruct-2507 | 分析抽取 | 便宜档质检 detector · 影子评分(不碰生产额度) | 0.048 / 0.193 · 262K |
| qwen-2.5-7b-instruct | 分析抽取 | Vivi 对话记忆抽取 | 0.10 / 0.20 · 33K |
| Qwen3-VL-4B(本地权重) | 视觉理解 | 断网 / 无 key 兜底,8.3GB 本机跑,单图 8–40 秒 | 零 API 费 · 本地 |
| qwen3-235b-a22b | 回滚锚点 | 上一代主力,定价表常驻以便一行 env 回退 | 0.455 / 1.82 · 131K |
// 单价单位 USD / 百万 token,取自 OpenRouter 挂牌页,2026-08-07 逐个核验;qwen3-30b-2507 当时处于折扣价
2026-06-08 把 chat 槽从原版切到 2507 快照:同族、同厂、只换快照。
// 青=现役主力 · 蓝=视觉族 · 琥珀=已退役对照 · 灰=便宜档
$0.455 → $0.09。评论与人设 prompt 长,输入侧占大头,这一刀最疼。
$1.82 → $0.55。私信本身短,输出侧省得少,但仍是三分之一。
同族快照,人设 prompt 一字未改,无跨厂商的口吻漂移。
这次换代拿到的红利是成本砍掉八成,不是效果飞跃。去偏评测里所有候选的自然度都卡在 3.4~3.5 一线——真正的杠杆在 prompt,不在换模型。
两轮横评,都走生产代码路径、都换过中立裁判去偏——结论有一个反直觉。
// 原默认其实是三者里最贵且杜撰最多的那个 · 分值为 1–5 分制
// 五模型参评,中间两名(glm-4.7 / deepseek-v4-pro)分值未留档,此处不列
照第二轮结论切了 kimi,07-21 又全量回滚到 2507。原因不在质量分:kimi 是推理模型,我们只传了 effort:low 压不住,每条烧 100~868 reasoning token,单条回复 131~171 秒,击穿中转层 110 秒与客户端 120 秒两道天花板,在用户侧表现为「机器人不回话」。
评测只测了质量、没测 wall-clock 延迟,就会选出一个线上跑不动的冠军。2507 的赢面从来不是分数最高,而是非推理、秒回、话术稳——面客链路上,可预测的延迟本身就是一项能力。
模型可以换,护栏不能省——这四件事让我们敢在面客链路上灰度。
抖音与企微两条 chat 通道各有独立 env 键,可分别灰度。上代 slug 常驻定价表,回退不用改代码、不用发版。
每 15 分钟巡检面客通道的平均 reasoning token,超阈值推红牌告警——专防「有人把非推理槽误切成推理模型」这类静默升级。
所有 bake-off 走独立 key,后台设了额度上限,烧超直接 402 停住,碰不到生产额度。这条是被真实事故换来的。
网关返回 cost=0,我们用本地定价表把每次调用的成本手动写回 trace,做到按人、按任务、按通道追账。
确定性判断交给代码,模糊判断才交给模型——路由、重试、状态码、去重全走代码;分类、起草、摘要、抽取才走模型。能用状态码回答的,不让模型在 prompt 里抖 if-else。
这一节写给千问团队看——都是生产实测,不是理论风险。
response_format: json_object 会让 Qwen3 输出退化,我们已全线弃用以上现象全部基于 OpenRouter 通道的实测。同款模型在 DashScope 官方通道上是否一致,我们没有对照数据——这也是本次交流想确认的第一件事。
按我们卡住的位置排的,越靠前越影响下一步决策。
// 玫红=视觉 · 琥珀=格式 · 蓝=选型 · 青=成本 · 紫=能力