大模型基础 · AIGC 全景 · 2026-07

AI 内容生成四件套

文生图、文生视频、图生视频、视频配音——到 2026 年 7 月,这四个环节第一次能串成一条不需要摄像机的内容生产线。这篇按环节讲透:每个环节的底层原理、各大厂商过去 60 天的最新发布、GitHub 上高收藏的开源选择,以及我们团队在 Softie 和 Akke 里的真实实践与合规红线。

篇幅 8 章 · 约 25 分钟 受众 全员 · 不需要会写代码 数据 核实于 2026-07-12(价格与版本号超 30 天请重新核对)
01

Section 01 · The Pipeline

四个环节,串成一条不需要摄像机的生产线

先建立全局图景。「用 AI 做一条视频」在 2026 年的标准流程是这样五步——本文的四个主题,就是其中四个环节:

✍️

剧本 / 提示词

LLM
写脚本 · 分镜

🖼️

文生图

角色定妆照
分镜关键帧

🎬

图生视频

让画面动起来
生产主力环节

🔊

配音 / 音效

TTS · 对口型
BGM · 拟音

📦

成片

剪辑 · 字幕
AI 标识 · 发布

为什么「图生视频」是中间那个高亮的主力环节?因为直接让模型从文字生成视频像抽卡,而先生成图、审核满意后再让图动起来,才是可控的施工流程——第 05 章会展开。而 2026 年最大的一个变化是:第 3、4 步正在合并。新一代视频模型(Veo 3.1、可灵 3.0、Seedance 2.5、Vidu Q3)能在生成画面的同一次运算里,连对白、口型、音效、配乐一起生成——业内叫「音画同出」。

过去 60 天发生了什么

这个领域的迭代速度需要亲眼看一遍才有体感。下面是 2026 年 5 月以来的主要发布( 图像 / 视频 / 音频):

2026-05-08 图像

HiDream-O1 开源

8B「像素级统一 Transformer」:砍掉 VAE 和独立文本编码器的新架构,发布时开源生图第一。

2026-05-19 视频

Google I/O:Gemini Omni Flash

统一多模态「生成 + 对话式编辑」:一句话改视频局部,保持角色与光照连续;6 月 30 日开放 API。

2026-06-03 / 06-10 图像

Ideogram 4.0 开放权重 · Midjourney V8.1 转正

文字渲染王者 Ideogram 开放模型权重(代码 Apache、权重商用需付费许可);MJ V8.1 成为默认版本。

2026-06-11 音频

ElevenLabs Music v2

二代文生音乐,支持局部重生成(inpainting),API 降价至多 50%。

2026-06-16 / 06-17 视频

xAI Grok Imagine Video 1.5 · 可灵 Kling 3.0 Turbo

Grok 图生视频 API 正式可用;可灵推出 Turbo 档——带音频 1080P 降到 ¥1/秒。

2026-06-23 视频 + 音频

字节 FORCE 大会:Seedance 2.5 + Seed-Audio 1.0

视频侧原生单次 30 秒、4K、最多 50 个参考素材;音频侧一次直出对白 + 音效 + 配乐,最长 2 分钟。

2026-06-30 图像

Nano Banana 2 Lite

Google 的量产低价档:约 4 秒一张、约 $0.034/张。

2026-07-06 / 07-08 音频

OpenAI gpt-realtime-2.1 · GPT-Live

实时语音延迟再降 25%+;GPT-Live 全双工——边听边说、可以被打断。

2026-07-07 / 07-08 图像

Meta Muse Image · 字节 Seedream 5.0 Pro

Meta 超级智能实验室首个图像模型;Seedream 5.0 Pro 把「图层分离 + 选区编辑」带进生图模型。

同期最大的反面新闻 · OpenAI 的 Sora 消费级应用已于 2026-04-26 关停,API 也将在 2026-09-24 停用(官方公告)。多家媒体报道的原因:运营成本与收入严重倒挂,叠加版权争议。头部玩家退场提醒我们——这个领域榜首每季度都在换,选型要看生产适配度,不要追热搜
02

Section 02 · How It Works

从一团噪声里,把画面「猜」出来

扩散模型:主流生成方式

今天绝大多数生图/生视频模型的底层是扩散模型(Diffusion)。训练时,把一张清晰图片一步步加噪声直到变成雪花点,让模型学习「每一步怎么把噪声去掉一点」;生成时反过来——从一团纯噪声出发,按你的文字描述,一步步去噪,直到浮现出一张符合描述的图。看下面这个循环动画:

t = 1000 纯噪声 「山间落日」→ 逐步去噪 t = 0 成图

文字描述如何「指挥」去噪?靠一个文本编码器把你的话翻译成向量(参见我们的表征学习那篇),在每一步去噪时通过注意力机制「盯着」这些向量。2026 年的新趋势是:文本编码器直接换成完整的视觉语言模型(VLM)——FLUX.2 用 24B 的 Mistral-3,Ideogram 4.0 用 Qwen3-VL——让模型带着世界知识理解长指令,而不只是匹配关键词。

三条架构路线

路线怎么生成代表强项
扩散 DiT + 流匹配Transformer 骨架做去噪;流匹配(flow matching)把「噪声→图像」的路径拉直,更少步数出图FLUX.2、Ideogram 4.0、SD 3.5、绝大多数视频模型质量/成本比最优,当前主流
自回归(AR)像大语言模型一样「一块一块」把图写出来GPT Image 全系、腾讯混元 Image 3.0(LLM 底座直接生图)与语言模型天然统一:能先「想」再画、能联网查资料
像素级统一 Transformer文字、像素、条件放进同一个 token 空间,不再需要 VAE 和独立文本编码器HiDream-O1(2026-05 开源)结构最简洁的新物种,生成/编辑/个性化一个模型全包
2026 年生图的主叙事:先想清楚,再动笔 · GPT Image 2、Seedream 5.0、Meta Muse 都在生成前加了一步「推理」——先规划构图和文字排版、必要时联网检索参考、生成后自检。信息图、多物体、图内文字这些老大难场景因此明显变好。这和大语言模型「先思考再回答」是同一条路线在图像上的复刻。

视频 = 图像的时空扩展,难在「记住自己画过什么」

视频模型把扩散从单张图扩展到几十上百帧:注意力机制不仅看「这一帧里各处的关系」,还看「帧与帧之间的关系」(时空注意力)。代价是计算量爆炸——所以 2026 年的效率创新集中在稀疏注意力(只算重要的帧间关系)和步数蒸馏(把几十步去噪压到 8 步)。而长视频的难点是一致性:主角的脸不能越走越变形。产品端两条路——Seedance 2.5 用「原生单次 30 秒」硬扛,Veo 用「场景扩展」逐段接力;研究端自回归路线正在回潮,用「逐段生成 + 记忆」解决误差累积。

音画同出:两座塔,边画边配音

「生成的视频自带对白和音效」不是先生成画面再配音,而是两个模型塔并行生成、每一层互相「对视」——业内主流实现是双塔 DiT:

视频塔 · DiT

负责画面 token 去噪
看到「音频塔正在生成爆炸声」
→ 画面同步出现火光

每层双向
cross-attention

音频塔 · DiT

负责声音 token 去噪
看到「视频塔画到了口型开合」
→ 对白帧级对齐嘴型

这套架构 2025 年由 Sora 2 / Veo 3 打头,2025 年 12 月到 2026 年 2 月被中国厂商(可灵 2.6、Vidu Q3、Wan 2.6、Seedance 2.0)密集补齐,「音画同出」维度上的中美代差基本抹平。开源侧的代表是 LTX-2:14B 视频塔 + 5B 音频塔,一张 4090 就能跑。

03

Section 03 · Text-to-Image

最卷的赛道:从「画得像」卷到「听得懂、改得动」

文生图是四件套里最成熟的环节——2026 年头部模型的输出已经很难和摄影/设计稿区分,竞争焦点转向三件事:指令编辑(「把左边那个人的外套换成红色」而不是重新抽卡)、文字渲染(海报里的中文别再是乱码)、角色一致性(同一个角色画 100 张不走样——这直接决定它能不能当视频生产线的上游)。

商业模型格局(2026-07)

模型厂商 · 最新版杀手锏
GPT Image 2OpenAI · 2026-04-21自回归 + 生成前推理(联网检索、自检),发布即登顶 Image Arena、创历史最大领先幅度
Nano Banana 2 / Pro / LiteGoogle · Lite 2026-06-30 NEW最多 5 个角色一致性 + 14 个物体保真;Lite 档 4 秒 $0.034 主打量产
Seedream 5.0 Pro字节 · 2026-07-08 NEW智能图层分离 + 点/框/套索选区编辑——生图模型第一次长出「设计软件的手感」;10+ 语言原生文字渲染
Midjourney V8.1Midjourney · 2026-06-10 转正美学风格化天花板,快 4-5 倍、原生 2K;仍无官方 API,只能订阅
FLUX.2 [pro]Black Forest Labs · 2025-1132B 流匹配 + VLM 文本编码器;开发者生态最全(编辑/扩图/擦除/试穿全家桶)
Recraft V4.1Recraft · 2026-05-14 NEW设计师赛道:唯一原生输出矢量 SVG 的一线模型
Meta Muse ImageMeta · 2026-07-07 NEW超级智能实验室首秀,面向 Meta 系消费产品,暂无开发者 API

一张图多少钱(API 官方牌价)

文生图 API 单价 · 约 1K 分辨率 · USD/张 · 2026-07-12
FLUX.2 [pro]
$0.030
NB 2 LiteGoogle
$0.034
Recraft V4.1
$0.035
Nano Banana 2
$0.045
GPT Image 2中档画质
≈$0.053
Ideogram 4.0Default 档
$0.060
Seedream 5.0 Profal 平台
$0.0675
GPT Image 2 按 token 计费(画质档位差价极大:低档 ≈$0.006、高档 ≈$0.21),此处取中档估算;各家 Batch 批量接口普遍半价;4K 输出均显著加价。价格随时变动,接入前以官方 pricing 页为准。

开源侧:能免费商用的都在这里

模型规格许可定位
FLUX.2 [klein]4B · 2026-01Apache 2.0亚秒级生成 + 编辑,可跑在笔记本上(2026-06 已随 ASUS 硬件出货)
Qwen-Image-251220B · 2025-12Apache 2.0已确认开源里的画质最强档;中文文字渲染标杆
HunyuanImage 3.0-Instruct80B MoE · 2026-01腾讯社区许可自回归路线开源代表,编辑榜前七唯一开源;注意地域与规模限制条款
HiDream-O18B · 2026-05 NEW开源像素级统一 Transformer 新架构,发布时开源第一
Ideogram 4.09.3B · 2026-06 NEW代码 Apache / 权重商用需付费英文文字渲染最强开源;⚠️ 别被「开源」标题骗了,商用权重要买许可
SD 时代正式落幕 · 曾经的开源霸主 Stability AI 整个 2026 年上半年没有新基础模型,SDXL 转为存量微调生态。开源生图的接力棒已经交到 FLUX(德国)、Qwen / 混元 / HiDream(中国)手里。我们 Softie 生产线上的 SDXL 工作流仍在服役,但新需求已默认评估 FLUX 系。
04

Section 04 · Text-to-Video

音画同出成为标配,战场转向时长、4K 与价格

2026 年中的文生视频,「不看标识分不清 AI 与真人」已是头部模型的常态(这是我们 7 月调研的硬结论之一)。竞争维度变成了四个硬指标:单次时长(10 秒 → 30 秒)、原生分辨率(1080P → 4K)、音画同出质量(口型、多角色对话)、每秒价格

商业格局(2026-07)

模型厂商 · 最新版时长 / 分辨率特点
Seedance 2.5字节 · 2026-06-23 NEW原生单次 30 秒 · 4K 10-bit最多 50 个参考素材(图+视频+音频)、区域级编辑;API 2026-07-16 上线
Kling 3.0 / Omni / Turbo快手 · Turbo 2026-06-17 NEW15 秒 · 业界首个原生 4K(04-23)中文对白口型全球顶级、多语种方言;曾登 Arena 文生视频全球第一
Veo 3.1 + Omni FlashGoogle · Omni Flash API 2026-06-30 NEW单次 8 秒,场景扩展可到 1 分钟+综合画质第一梯队;Omni Flash 开创「对话式改视频」
Runway Gen-4.5Runway · 2025-122026 年初曾登顶 Arena;6 月起 API 反而接入了字节 Seedance——模型公司在变聚合平台
Vidu Q3生数科技 · 2026-0116 秒 1080P口型同步误差 ±15ms,一次生成语音+BGM+音效
Wan 2.6 / 2.7阿里 · 2.7 于 2026 春上线 API15 秒 1080PR2V:给一段参考视频,同时克隆人物外形和声音
Hailuo 2.3 / 03MiniMax · 03 约 2026-066-10 秒性价比之王(低至 $0.05/秒档);03 版本信息以官网为准
Sora 2OpenAI10-25 秒退场中 App 已停,API 2026-09-24 停用,别再接

一秒视频多少钱

视频生成 API 单价 · USD/秒(¥ 按 7.2 折算)· 2026-07-12
Hailuo 2.3768P
≈$0.05
Sora 2720P·将停用
$0.10
Kling 3.0 Turbo1080P 有声
¥1.0≈$0.14
Veo 3.1 Fast
≈$0.15
Seedance 2.0720P·fal
$0.30
Veo 3.11080P 有声
$0.40
Sora 2 Pro1080P
$0.50-0.70
可灵 2.6 官方价(我们 2026-07-11 官网实测):有声 1080P ¥1.0-1.2/秒、无声 ¥0.3-0.5/秒。算一笔账:一条 30 秒成片按 3 倍重 roll 计,纯模型成本约 ¥15-65——已经稳稳落在「单条 50-200 元」的商用预算内。Seedance 2.5 定价待 7 月中 API 上线后公布。

开源侧:一张 4090 能跑什么

模型规格许可能力
Wan 2.2阿里 · MoE A14B / 5BApache 2.05 秒 720P,T2V/I2V/S2V 全家桶;许可最干净的自托管首选。注意 2.5 以后已闭源,别被版本号误导
LTX-2 / 2.3Lightricks · 14B+5B / 22B年收入 < $1000 万免费商用开源唯一单 pass 原生音画同出,4K 50fps,单卡 4090 可跑;2.3(2026-03)画质再升级
HunyuanVideo-1.5腾讯 · 8.3B排除欧盟/英国/韩国13.6GB 显存可推理,低配机器兜底;网传「Apache 许可」是讹传,我们核验过 LICENSE 原文
05

Section 05 · Image-to-Video

生产线的真正主力:先审图,再花钱

如果只看演示视频,你会以为大家都在用「一句话直出视频」。但真实生产里,几乎所有严肃的工作流走的都是图生视频。原因很简单:

图生视频(施工图模式)

先用文生图批量出分镜关键帧——几分钱一张,不满意就重来;人工审过关键帧后,再让贵的视频模型「照图施工」。角色长相、构图、光线在动之前就锁定了。

vs

文生视频(抽卡模式)

一句话直接出视频,每次几块到几十块。构图、角色、运镜全凭模型发挥,不满意只能整条重抽——钱和时间都烧在盲盒上。

所以文生图和图生视频的关系是上下游:文生图负责便宜地「确定长什么样」,图生视频负责昂贵地「让它动起来」。这也解释了为什么第 03 章说角色一致性是文生图的核心竞争力——它直接决定这条流水线能不能量产同一个主角的系列内容。

2026 上半年两条演进线

第一条:参考素材军备竞赛。模型能「看着」多少参考素材来生成,直接决定角色/场景/风格的锁定能力:

单次生成可挂载的参考素材数量 · 2026-07
Veo 3.1Ingredients
4 张图
Seedance 2.0
9图+3视频+3音频
Seedance 2.52026-06
50 个素材
可灵 3.0 的多参考图(@Element 语法逐镜引用角色)与 Vidu Q3-Mix 走同一方向;素材类型也从「图」扩展到「视频 + 音频」。

第二条:从参考图到参考视频。阿里 Wan 2.6 的 R2V 给一段参考视频就能同时克隆人物外形和声音;Luma Ray3 Modify 反过来——拿参考图去改实拍素材,保留原片的表演和眼神。「参考」的含义正在从静态长相扩展到动态神态。

常用控制手段速查

我们的选型结论(2026-07,Akke 短剧流水线调研 v2)· 主路线可灵 Kling 3.0 官方 API:中文对白口型全球顶级 + 人民币透明定价 + 国内直连 + 多参考图角色一致性 + 逐镜 prompt 可控。备选 Seedance(音画同出 + 自动对口型),降本备选 Wan 2.2 自托管。Veo 中文弱且国内难直连;Sora 2 已进退场倒计时。完整调研报告见 upio.ai/workflow/ai-drama-2026-07
06

Section 06 · Voice & Dubbing

三段式管线被「一次直出」挑战,但可控性仍是护城河

给视频配上声音,传统上是一条三段式管线:转写/翻译(ASR)→ 语音合成(TTS)→ 对口型(lip-sync)。2026 年它同时面对两股力量:一边是音画同出让「新生成的短视频」根本不需要单独配音;另一边是存量视频翻译、品牌指定音色、逐字准确的台词——这些「一次直出」做不到的场景,撑起了专业配音工具的护城河。

原生音画同出

一条 prompt,画面和对白同时生成,口型帧级对齐。适合全新生成的短内容。短板:改一个字要整段重生成,音色不能精确指定。

vs

三段式配音管线

音轨每个字可控、音色可克隆可复用、多语言批量翻译。适合存量视频本地化和品牌内容。短板:贵——对口型是全链路最贵一环。

折中形态正在兴起:audio-first · 先用音频模型把成品音轨做好(对白、情绪、节奏都验收完),再把音轨喂给 Seedance / 可灵,让画面「跟着声音演」。声音的可控性 + 画面的生成力,两头都占。

商业格局:三个关键玩家 + 一个王炸

产品最新动态定位
ElevenLabsv3 正式 GA(2026-02);Dubbing v2 跨语言保留原声音色;Music v2(06-11)NEW表现力天花板:音频标签控制耳语/大笑,70+ 语言
字节 Seed-Audio 1.02026-06-23 发布 NEW6 月配音赛道最重要发布:一次请求直出多角色对白 + 情绪 + 方言 + BGM + 拟音,最长 2 分钟,影视级
OpenAI 语音线gpt-realtime-2.1(07-06)、GPT-Live 全双工(07-08)NEW强在实时对话与同传(70+ 语种→13 语种),长音频表现力弱于前两家;gpt-4o-mini-tts 仍是最便宜一线 TTS(≈$0.015/分钟)
MiniMax Speech 2.82026 年初上线中文配音性价比第一梯队:40+ 语言、7 情绪模式、20+ 语气词标签
豆包声音复刻 2.0火山引擎5 秒素材克隆、相似度 97.5%;音色年费约 ¥150——量产矩阵号的成本利器
HeyGenAvatar V + 视频翻译 3.0(2026-04)存量视频一键翻成 175+ 语言/方言,保留原声音色、口型重构
sync.so(sync-3)2026-04 发布专业对口型:特写/侧脸/遮挡自动处理,$0.085/秒——注意这等于 $5.1/分钟,全链路最贵一环

开源 TTS:GitHub 上最热闹的角落

项目Stars许可一句话
GPT-SoVITS59.7kMIT1 分钟素材克隆声音,中文社区生态最大,持续活跃
voicebox40.8kMIT2026 年现象级新秀:开源声音工作室,半年冲 4 万星 NEW
ChatTTS39.6kAGPL对话场景经典,但 AGPL 商用受限、热度回落
Fish Speech / OpenAudio31.2k研究许可⚠️ 2026-03 起许可收紧为研究用途——凭旧印象商用会踩雷
CosyVoice 322.1kApache 2.0阿里出品,9 语言 + 18 种中文方言,工业部署量最大的开源底座之一
IndexTTS-221.8kB站自定义首个能精确控制合成时长的 AR TTS——为配音对轨而生
Qwen3-TTS12.4kApache 2.02026-01 全家桶开源:0.6B/1.7B、首包 97ms、8G 显存本地部署——上半年最重要的开源 TTS 发布
F5-TTS14.9k权重非商用零样本克隆快,但权重 CC-BY-NC,商用需自训

配音管线的上游——字幕与时间轴——事实标准是 WhisperX(词级时间戳 + 说话人分离,23k stars,仍在活跃更新);对口型开源侧则整体停滞(MuseTalk、LatentSync 均一年未更),与商业闭源的差距在 2026 年被拉大。配乐版权方面注意:Suno 免费档禁商用、Udio 已变成不可导出的「围墙花园」,商用配乐最安全的开源选项是 ACE-Step(Apache 2.0)

按场景选工具

07

Section 07 · Open Source

星标地图:哪些是活的引擎,哪些是纪念碑

GitHub 星标是这个领域的「人气指数」,但星高不等于活着。下图是四个领域高星项目的全景(star 数为 2026-07-12 经 GitHub API 实测),灰色的是已停更的「纪念碑」:

AIGC 高星开源项目 · GitHub Stars(千)· 2026-07-12 实测
SD WebUIA1111·生图
164k 停更
ComfyUI工作流引擎
120k
WhisperASR
105k
MoneyPrinterTurbo一键成片
97k ↑
GPT-SoVITS声音克隆
60k
Fooocus生图 UI
51k 停更
coqui TTS
46k 停更
voicebox2026 新秀
41k ↑↑
OpenMontageagentic 成片
37k ↑↑
diffusersHF 标准库
34k
灰色 = 一年以上无实质更新。↑ = 2026 年上半年高速增长(MoneyPrinterTurbo 6 月单月 +2.9 万星、OpenMontage +2.2 万、voicebox 半年从零到 4 万)。

2026 上半年 GitHub 新蹿升的方向

三个信号值得注意:① 一键成片流水线爆发——MoneyPrinterTurbo(MIT,文案→素材→配音→字幕全自动)重回增长巅峰,agentic 视频系统 OpenMontage 三个月冲 3.7 万星,小说转动画短剧的 Toonflow(11.4k)、AI 短剧工作台 Jellyfish(5.2k)都是 2026 年新项目——开源社区在集体把「四件套」拼成产线② 语音赛道井喷——voicebox、Qwen3-TTS、支持 600+ 语言的 OmniVoice(8.2k)都是半年内的新面孔;③ 视频模型开源两强确立——LTX-2(8.2k,唯一原生音画同出)与 Wan 2.2(16.6k,许可最干净)。

商用前必读:许可红线

这些项目商用有硬约束 · AGPL(SD WebUI、ChatTTS、OpenMontage、Postiz):改了代码做线上服务必须开源,闭源产品需进程级隔离;无 License(Wav2Lip):默认保留所有权利,商用需单独授权;许可中途收紧(Fish Speech 2026-03 起改研究用途):引入前查当前 LICENSE,别信旧文章;地域/规模排除(腾讯混元系列排除欧盟/英国/韩国,月活超 1 亿另谈);「开源」但权重收费(Ideogram 4.0、F5-TTS 权重非商用)。
商用最安全的一套组合(全部 MIT / Apache / BSD)· 生图 diffusers + FLUX.2 klein / Qwen-Image → 视频 Wan 2.2 → 声音 GPT-SoVITS / CosyVoice / Qwen3-TTS → 字幕 faster-whisper / WhisperX → 成片 MoneyPrinterTurbo / VideoLingo / auto-editor。ComfyUI(GPL-3.0)作为内部工具使用没问题,打包分发需注意。
08

Section 08 · How We Use It

两条真实生产线,和三条不能碰的合规红线

Softie:图片/视频生成工作流

Softie 的图片生成走的是自托管路线:ComfyUI 编排生成工作流(workflow 导出 JSON 进 Git 做版本控制),GPU 跑在 RunPod Serverless 上(SDXL / FLUX 双 endpoint,按秒计费、无请求时不花钱),n8n 串联业务编排。这套架构的价值在第 07 章的星标图里能找到对应——ComfyUI 是事实上的工作流标准,而我们踩过的坑(FLUX 的 cfg 参数、27GB 镜像逼近 CI 磁盘上限)都记录在内部 memory。视频侧的自托管选型结论与本文一致:Wan 2.2 首选(Apache 许可 + ComfyUI 生态全),成片底座评估 MoneyPrinterTurbo(MIT),出海发布 Postiz 注意 AGPL 隔离。

Akke:短剧内容流水线的两轮选型

Akke 的视频流水线调研走了两轮,结论的演变本身就是这个领域的缩影:

合规:三条红线,比画质更先验证

红线一 · AI 内容必须主动标识 · 《人工智能生成合成内容标识办法》2025-09-01 施行。抖音等平台走双轨检测:发布时主动声明 + 文件元数据隐式标识;不声明会被检测后强制打「疑似 AI」标——对账号权重的伤害比主动声明大得多。流水线必须默认打标,不做规避。
红线二 · AI 虚构人设不能做推荐证明 · 巨量千川广告规则:不得使用「难以核实的人设」做推荐证明——AI 生成的「业主/设计师」出镜讲使用效果,就是踩线。合规打法:把 AI 人物明示为「剧情演绎/情景短剧」,而不是伪装成真实客户证言。
红线三 · 版权与肖像 · Seedance 2.0 因逼真复刻影视角色收到 Disney 律师函、Sora 因版权争议加速退场——平台方都在收紧。用参考图功能时,参考素材的版权和肖像权是自己的责任。

如果你想上手,从这里开始

模型每个季度都在换榜首,但生产线的骨架已经稳定——学会控制、算账与合规,比追逐任何一个「最强模型」都值钱。