文生图、文生视频、图生视频、视频配音——到 2026 年 7 月,这四个环节第一次能串成一条不需要摄像机的内容生产线。这篇按环节讲透:每个环节的底层原理、各大厂商过去 60 天的最新发布、GitHub 上高收藏的开源选择,以及我们团队在 Softie 和 Akke 里的真实实践与合规红线。
先建立全局图景。「用 AI 做一条视频」在 2026 年的标准流程是这样五步——本文的四个主题,就是其中四个环节:
LLM
写脚本 · 分镜
角色定妆照
分镜关键帧
让画面动起来
生产主力环节
TTS · 对口型
BGM · 拟音
剪辑 · 字幕
AI 标识 · 发布
为什么「图生视频」是中间那个高亮的主力环节?因为直接让模型从文字生成视频像抽卡,而先生成图、审核满意后再让图动起来,才是可控的施工流程——第 05 章会展开。而 2026 年最大的一个变化是:第 3、4 步正在合并。新一代视频模型(Veo 3.1、可灵 3.0、Seedance 2.5、Vidu Q3)能在生成画面的同一次运算里,连对白、口型、音效、配乐一起生成——业内叫「音画同出」。
这个领域的迭代速度需要亲眼看一遍才有体感。下面是 2026 年 5 月以来的主要发布(● 图像 / ● 视频 / ● 音频):
8B「像素级统一 Transformer」:砍掉 VAE 和独立文本编码器的新架构,发布时开源生图第一。
统一多模态「生成 + 对话式编辑」:一句话改视频局部,保持角色与光照连续;6 月 30 日开放 API。
文字渲染王者 Ideogram 开放模型权重(代码 Apache、权重商用需付费许可);MJ V8.1 成为默认版本。
二代文生音乐,支持局部重生成(inpainting),API 降价至多 50%。
Grok 图生视频 API 正式可用;可灵推出 Turbo 档——带音频 1080P 降到 ¥1/秒。
视频侧原生单次 30 秒、4K、最多 50 个参考素材;音频侧一次直出对白 + 音效 + 配乐,最长 2 分钟。
Google 的量产低价档:约 4 秒一张、约 $0.034/张。
实时语音延迟再降 25%+;GPT-Live 全双工——边听边说、可以被打断。
Meta 超级智能实验室首个图像模型;Seedream 5.0 Pro 把「图层分离 + 选区编辑」带进生图模型。
今天绝大多数生图/生视频模型的底层是扩散模型(Diffusion)。训练时,把一张清晰图片一步步加噪声直到变成雪花点,让模型学习「每一步怎么把噪声去掉一点」;生成时反过来——从一团纯噪声出发,按你的文字描述,一步步去噪,直到浮现出一张符合描述的图。看下面这个循环动画:
文字描述如何「指挥」去噪?靠一个文本编码器把你的话翻译成向量(参见我们的表征学习那篇),在每一步去噪时通过注意力机制「盯着」这些向量。2026 年的新趋势是:文本编码器直接换成完整的视觉语言模型(VLM)——FLUX.2 用 24B 的 Mistral-3,Ideogram 4.0 用 Qwen3-VL——让模型带着世界知识理解长指令,而不只是匹配关键词。
| 路线 | 怎么生成 | 代表 | 强项 |
|---|---|---|---|
| 扩散 DiT + 流匹配 | Transformer 骨架做去噪;流匹配(flow matching)把「噪声→图像」的路径拉直,更少步数出图 | FLUX.2、Ideogram 4.0、SD 3.5、绝大多数视频模型 | 质量/成本比最优,当前主流 |
| 自回归(AR) | 像大语言模型一样「一块一块」把图写出来 | GPT Image 全系、腾讯混元 Image 3.0(LLM 底座直接生图) | 与语言模型天然统一:能先「想」再画、能联网查资料 |
| 像素级统一 Transformer | 文字、像素、条件放进同一个 token 空间,不再需要 VAE 和独立文本编码器 | HiDream-O1(2026-05 开源) | 结构最简洁的新物种,生成/编辑/个性化一个模型全包 |
视频模型把扩散从单张图扩展到几十上百帧:注意力机制不仅看「这一帧里各处的关系」,还看「帧与帧之间的关系」(时空注意力)。代价是计算量爆炸——所以 2026 年的效率创新集中在稀疏注意力(只算重要的帧间关系)和步数蒸馏(把几十步去噪压到 8 步)。而长视频的难点是一致性:主角的脸不能越走越变形。产品端两条路——Seedance 2.5 用「原生单次 30 秒」硬扛,Veo 用「场景扩展」逐段接力;研究端自回归路线正在回潮,用「逐段生成 + 记忆」解决误差累积。
「生成的视频自带对白和音效」不是先生成画面再配音,而是两个模型塔并行生成、每一层互相「对视」——业内主流实现是双塔 DiT:
负责画面 token 去噪
看到「音频塔正在生成爆炸声」
→ 画面同步出现火光
负责声音 token 去噪
看到「视频塔画到了口型开合」
→ 对白帧级对齐嘴型
这套架构 2025 年由 Sora 2 / Veo 3 打头,2025 年 12 月到 2026 年 2 月被中国厂商(可灵 2.6、Vidu Q3、Wan 2.6、Seedance 2.0)密集补齐,「音画同出」维度上的中美代差基本抹平。开源侧的代表是 LTX-2:14B 视频塔 + 5B 音频塔,一张 4090 就能跑。
文生图是四件套里最成熟的环节——2026 年头部模型的输出已经很难和摄影/设计稿区分,竞争焦点转向三件事:指令编辑(「把左边那个人的外套换成红色」而不是重新抽卡)、文字渲染(海报里的中文别再是乱码)、角色一致性(同一个角色画 100 张不走样——这直接决定它能不能当视频生产线的上游)。
| 模型 | 厂商 · 最新版 | 杀手锏 |
|---|---|---|
| GPT Image 2 | OpenAI · 2026-04-21 | 自回归 + 生成前推理(联网检索、自检),发布即登顶 Image Arena、创历史最大领先幅度 |
| Nano Banana 2 / Pro / Lite | Google · Lite 2026-06-30 NEW | 最多 5 个角色一致性 + 14 个物体保真;Lite 档 4 秒 $0.034 主打量产 |
| Seedream 5.0 Pro | 字节 · 2026-07-08 NEW | 智能图层分离 + 点/框/套索选区编辑——生图模型第一次长出「设计软件的手感」;10+ 语言原生文字渲染 |
| Midjourney V8.1 | Midjourney · 2026-06-10 转正 | 美学风格化天花板,快 4-5 倍、原生 2K;仍无官方 API,只能订阅 |
| FLUX.2 [pro] | Black Forest Labs · 2025-11 | 32B 流匹配 + VLM 文本编码器;开发者生态最全(编辑/扩图/擦除/试穿全家桶) |
| Recraft V4.1 | Recraft · 2026-05-14 NEW | 设计师赛道:唯一原生输出矢量 SVG 的一线模型 |
| Meta Muse Image | Meta · 2026-07-07 NEW | 超级智能实验室首秀,面向 Meta 系消费产品,暂无开发者 API |
| 模型 | 规格 | 许可 | 定位 |
|---|---|---|---|
| FLUX.2 [klein] | 4B · 2026-01 | Apache 2.0 | 亚秒级生成 + 编辑,可跑在笔记本上(2026-06 已随 ASUS 硬件出货) |
| Qwen-Image-2512 | 20B · 2025-12 | Apache 2.0 | 已确认开源里的画质最强档;中文文字渲染标杆 |
| HunyuanImage 3.0-Instruct | 80B MoE · 2026-01 | 腾讯社区许可 | 自回归路线开源代表,编辑榜前七唯一开源;注意地域与规模限制条款 |
| HiDream-O1 | 8B · 2026-05 NEW | 开源 | 像素级统一 Transformer 新架构,发布时开源第一 |
| Ideogram 4.0 | 9.3B · 2026-06 NEW | 代码 Apache / 权重商用需付费 | 英文文字渲染最强开源;⚠️ 别被「开源」标题骗了,商用权重要买许可 |
2026 年中的文生视频,「不看标识分不清 AI 与真人」已是头部模型的常态(这是我们 7 月调研的硬结论之一)。竞争维度变成了四个硬指标:单次时长(10 秒 → 30 秒)、原生分辨率(1080P → 4K)、音画同出质量(口型、多角色对话)、每秒价格。
| 模型 | 厂商 · 最新版 | 时长 / 分辨率 | 特点 |
|---|---|---|---|
| Seedance 2.5 | 字节 · 2026-06-23 NEW | 原生单次 30 秒 · 4K 10-bit | 最多 50 个参考素材(图+视频+音频)、区域级编辑;API 2026-07-16 上线 |
| Kling 3.0 / Omni / Turbo | 快手 · Turbo 2026-06-17 NEW | 15 秒 · 业界首个原生 4K(04-23) | 中文对白口型全球顶级、多语种方言;曾登 Arena 文生视频全球第一 |
| Veo 3.1 + Omni Flash | Google · Omni Flash API 2026-06-30 NEW | 单次 8 秒,场景扩展可到 1 分钟+ | 综合画质第一梯队;Omni Flash 开创「对话式改视频」 |
| Runway Gen-4.5 | Runway · 2025-12 | — | 2026 年初曾登顶 Arena;6 月起 API 反而接入了字节 Seedance——模型公司在变聚合平台 |
| Vidu Q3 | 生数科技 · 2026-01 | 16 秒 1080P | 口型同步误差 ±15ms,一次生成语音+BGM+音效 |
| Wan 2.6 / 2.7 | 阿里 · 2.7 于 2026 春上线 API | 15 秒 1080P | R2V:给一段参考视频,同时克隆人物外形和声音 |
| Hailuo 2.3 / 03 | MiniMax · 03 约 2026-06 | 6-10 秒 | 性价比之王(低至 $0.05/秒档);03 版本信息以官网为准 |
| Sora 2 | OpenAI | 10-25 秒 | 退场中 App 已停,API 2026-09-24 停用,别再接 |
| 模型 | 规格 | 许可 | 能力 |
|---|---|---|---|
| Wan 2.2 | 阿里 · MoE A14B / 5B | Apache 2.0 | 5 秒 720P,T2V/I2V/S2V 全家桶;许可最干净的自托管首选。注意 2.5 以后已闭源,别被版本号误导 |
| LTX-2 / 2.3 | Lightricks · 14B+5B / 22B | 年收入 < $1000 万免费商用 | 开源唯一单 pass 原生音画同出,4K 50fps,单卡 4090 可跑;2.3(2026-03)画质再升级 |
| HunyuanVideo-1.5 | 腾讯 · 8.3B | 排除欧盟/英国/韩国 | 13.6GB 显存可推理,低配机器兜底;网传「Apache 许可」是讹传,我们核验过 LICENSE 原文 |
如果只看演示视频,你会以为大家都在用「一句话直出视频」。但真实生产里,几乎所有严肃的工作流走的都是图生视频。原因很简单:
先用文生图批量出分镜关键帧——几分钱一张,不满意就重来;人工审过关键帧后,再让贵的视频模型「照图施工」。角色长相、构图、光线在动之前就锁定了。
一句话直接出视频,每次几块到几十块。构图、角色、运镜全凭模型发挥,不满意只能整条重抽——钱和时间都烧在盲盒上。
所以文生图和图生视频的关系是上下游:文生图负责便宜地「确定长什么样」,图生视频负责昂贵地「让它动起来」。这也解释了为什么第 03 章说角色一致性是文生图的核心竞争力——它直接决定这条流水线能不能量产同一个主角的系列内容。
第一条:参考素材军备竞赛。模型能「看着」多少参考素材来生成,直接决定角色/场景/风格的锁定能力:
第二条:从参考图到参考视频。阿里 Wan 2.6 的 R2V 给一段参考视频就能同时克隆人物外形和声音;Luma Ray3 Modify 反过来——拿参考图去改实拍素材,保留原片的表演和眼神。「参考」的含义正在从静态长相扩展到动态神态。
给视频配上声音,传统上是一条三段式管线:转写/翻译(ASR)→ 语音合成(TTS)→ 对口型(lip-sync)。2026 年它同时面对两股力量:一边是音画同出让「新生成的短视频」根本不需要单独配音;另一边是存量视频翻译、品牌指定音色、逐字准确的台词——这些「一次直出」做不到的场景,撑起了专业配音工具的护城河。
一条 prompt,画面和对白同时生成,口型帧级对齐。适合全新生成的短内容。短板:改一个字要整段重生成,音色不能精确指定。
音轨每个字可控、音色可克隆可复用、多语言批量翻译。适合存量视频本地化和品牌内容。短板:贵——对口型是全链路最贵一环。
| 产品 | 最新动态 | 定位 |
|---|---|---|
| ElevenLabs | v3 正式 GA(2026-02);Dubbing v2 跨语言保留原声音色;Music v2(06-11)NEW | 表现力天花板:音频标签控制耳语/大笑,70+ 语言 |
| 字节 Seed-Audio 1.0 | 2026-06-23 发布 NEW | 6 月配音赛道最重要发布:一次请求直出多角色对白 + 情绪 + 方言 + BGM + 拟音,最长 2 分钟,影视级 |
| OpenAI 语音线 | gpt-realtime-2.1(07-06)、GPT-Live 全双工(07-08)NEW | 强在实时对话与同传(70+ 语种→13 语种),长音频表现力弱于前两家;gpt-4o-mini-tts 仍是最便宜一线 TTS(≈$0.015/分钟) |
| MiniMax Speech 2.8 | 2026 年初上线 | 中文配音性价比第一梯队:40+ 语言、7 情绪模式、20+ 语气词标签 |
| 豆包声音复刻 2.0 | 火山引擎 | 5 秒素材克隆、相似度 97.5%;音色年费约 ¥150——量产矩阵号的成本利器 |
| HeyGen | Avatar V + 视频翻译 3.0(2026-04) | 存量视频一键翻成 175+ 语言/方言,保留原声音色、口型重构 |
| sync.so(sync-3) | 2026-04 发布 | 专业对口型:特写/侧脸/遮挡自动处理,$0.085/秒——注意这等于 $5.1/分钟,全链路最贵一环 |
| 项目 | Stars | 许可 | 一句话 |
|---|---|---|---|
| GPT-SoVITS | 59.7k | MIT | 1 分钟素材克隆声音,中文社区生态最大,持续活跃 |
| voicebox | 40.8k | MIT | 2026 年现象级新秀:开源声音工作室,半年冲 4 万星 NEW |
| ChatTTS | 39.6k | AGPL | 对话场景经典,但 AGPL 商用受限、热度回落 |
| Fish Speech / OpenAudio | 31.2k | 研究许可 | ⚠️ 2026-03 起许可收紧为研究用途——凭旧印象商用会踩雷 |
| CosyVoice 3 | 22.1k | Apache 2.0 | 阿里出品,9 语言 + 18 种中文方言,工业部署量最大的开源底座之一 |
| IndexTTS-2 | 21.8k | B站自定义 | 首个能精确控制合成时长的 AR TTS——为配音对轨而生 |
| Qwen3-TTS | 12.4k | Apache 2.0 | 2026-01 全家桶开源:0.6B/1.7B、首包 97ms、8G 显存本地部署——上半年最重要的开源 TTS 发布 |
| F5-TTS | 14.9k | 权重非商用 | 零样本克隆快,但权重 CC-BY-NC,商用需自训 |
配音管线的上游——字幕与时间轴——事实标准是 WhisperX(词级时间戳 + 说话人分离,23k stars,仍在活跃更新);对口型开源侧则整体停滞(MuseTalk、LatentSync 均一年未更),与商业闭源的差距在 2026 年被拉大。配乐版权方面注意:Suno 免费档禁商用、Udio 已变成不可导出的「围墙花园」,商用配乐最安全的开源选项是 ACE-Step(Apache 2.0)。
GitHub 星标是这个领域的「人气指数」,但星高不等于活着。下图是四个领域高星项目的全景(star 数为 2026-07-12 经 GitHub API 实测),灰色的是已停更的「纪念碑」:
三个信号值得注意:① 一键成片流水线爆发——MoneyPrinterTurbo(MIT,文案→素材→配音→字幕全自动)重回增长巅峰,agentic 视频系统 OpenMontage 三个月冲 3.7 万星,小说转动画短剧的 Toonflow(11.4k)、AI 短剧工作台 Jellyfish(5.2k)都是 2026 年新项目——开源社区在集体把「四件套」拼成产线;② 语音赛道井喷——voicebox、Qwen3-TTS、支持 600+ 语言的 OmniVoice(8.2k)都是半年内的新面孔;③ 视频模型开源两强确立——LTX-2(8.2k,唯一原生音画同出)与 Wan 2.2(16.6k,许可最干净)。
Softie 的图片生成走的是自托管路线:ComfyUI 编排生成工作流(workflow 导出 JSON 进 Git 做版本控制),GPU 跑在 RunPod Serverless 上(SDXL / FLUX 双 endpoint,按秒计费、无请求时不花钱),n8n 串联业务编排。这套架构的价值在第 07 章的星标图里能找到对应——ComfyUI 是事实上的工作流标准,而我们踩过的坑(FLUX 的 cfg 参数、27GB 镜像逼近 CI 磁盘上限)都记录在内部 memory。视频侧的自托管选型结论与本文一致:Wan 2.2 首选(Apache 许可 + ComfyUI 生态全),成片底座评估 MoneyPrinterTurbo(MIT),出海发布 Postiz 注意 AGPL 隔离。
Akke 的视频流水线调研走了两轮,结论的演变本身就是这个领域的缩影: