知识分享 · 工具入门 · AI 生成基建

AI 生成的
两种买法

fal.ai 是餐厅——一千多道现成模型按份收钱;RunPod 是出租厨房——带 GPU 的灶台按小时租给你。同一个需求「生成一张图」,两家是完全不同的买法。

// 面向全员 · 不需要会写代码 · 主线是团队图片 / 视频生成链路的真实选型

FAL.AI · 1000+ MODELS RUNPOD · GPU CLOUD FLUX.2 $0.012/MP RTX 4090 $0.69/H SERVERLESS · SCALE-TO-ZERO 2026-07 官方牌价
SCROLL / 向下滚动
01
Two Ways to Buy

按结果付钱,还是按时间付钱

所有「AI 生成」的成本,最后都落在 GPU 上。区别只在于你站在离 GPU 多远的地方付钱——离得越远越省心,离得越近越自由。

Model API◈ fal.ai

买结果

调 API → 传提示词 → 拿回图 / 视频

按「每张图 / 每秒视频」计费。GPU、模型部署、扩缩容全部不可见。点菜:菜单上有的,十分钟接通。

计费单位 · $/image · $/second
GPU Cloud✦ RunPod

买算力

租 GPU 机器 → 装自己的模型 → 自己跑

按「GPU 每秒 / 每小时」计费。生成什么、怎么生成全由你。开火:独门配方只能自己做。

计费单位 · $/GPU·hour(按秒计量)

往下每一层,你多担一层责任、也多拿一层控制权:

层次代表你负责平台负责
模型 APIfal.ai · Replicate写提示词、调 API模型、GPU、部署、扩缩容
Serverless GPURunPod Serverless · Modal打包自己的模型进 Docker 镜像GPU、按请求启停、排队
整租 GPURunPod Pods · Lambda · Vast.ai模型、环境、启停、利用率只管交出一台带卡的机器
Déjà vu

这和 Fly.io 那篇讲的「全托管 PaaS vs 租 VPS」是同一个故事在 GPU 世界的重演:fal 之于 RunPod ≈ Vercel 之于 Fly.io——只是这里的机器多了一块几万块钱的显卡,账单也放大了一个量级。

02
What is fal.ai

一千多个生成模型的「统一点菜口」

fal.ai 自我定位「面向开发者的生成式媒体平台」:把图像、视频、音频、3D 生成模型——官方口径超 1,000 个——包成同一套 API。FLUX、Kling、Veo、Seedance、Wan 全在菜单上,一个账号一个 key,今天调字节的模型、明天换 Google 的,代码几乎不用改。2025-12 完成 Sequoia 领投 D 轮 $140M,估值 $4.5B,一年翻三倍,是这条赛道的头部玩家。

🧾

BILLING · 按结果计费图像按张,视频按秒

成本和产出一一对应,不用关心 GPU 利用率——生成 100 张图的账单就是 100 × 单价。

🔀

QUEUE · 异步队列提交 → 回调

所有模型天生支持异步队列 + Webhook:提交任务立刻返回,生成完回调你的接口——长视频生成必须这么干

🧪

DX · 开发体验SDK + Playground

Python / JS 官方 SDK;网页 Playground 不写代码先试效果、看实时标价,横评模型时效率极高。

几个当前牌价感受一下量级(2026-07 官网 pricing 页):

模型类型牌价换算
FLUX.2 [dev]文生图$0.012 / MP一张 1024×1024 约 1 毛钱人民币
Seedream V4文生图$0.03 / 张一张约 2 毛
Wan 2.5视频$0.05 / 秒5 秒一条约 1.8 元
Kling 2.5 Turbo Pro视频$0.07 / 秒5 秒一条约 2.5 元
Kling O3 Standard视频$0.084–0.112 / 秒5 秒含音频约 4 元
Veo 3视频$0.40 / 秒5 秒一条约 14 元——旗舰价

⚠ 误解一 · Serverless GPU

  • pricing 页挂着 H100 $3.99/h 的 GPU 牌价
  • 但 fal Serverless 现在是企业客户申请制
  • 个人注册点进去只有「Request Access」
  • 对绝大多数用户,fal 就是个模型 API 平台

⚠ 误解二 · 中介费

  • Kling / Veo 等第三方模型经 fal 转售含 markup
  • 多付的是「一个 key 调所有家」的聚合便利
  • 量小、横评阶段:这笔钱花得值
  • 量大、模型锁定后:直调厂商更省(见第 5 章)

⚠ 误解三 · 余额即命门

  • 预充值扣款模式,余额清零立刻报错
  • 不是降速,是直接停
  • 接生产链路必须配余额监控告警
  • 我们被这个真实停过一次工
03
What is RunPod

把带显卡的机器,按秒租给你

RunPod 自我定位「AI Developer Cloud」:2022 年成立,2026-06 完成 Summit Partners 领投 $100M A 轮,估值 $1B,宣称开发者超百万、31 个地区有机房。它卖的东西很纯粹——带 GPU 的算力,三种形态:

Pods整租

一台 GPU 虚拟机

按需 / 抢占式(Spot)

整租一台带卡的机器,拿到就是你的。适合训练、微调、交互式实验——开着 ComfyUI 慢慢调。

RTX 4090 $0.69/h 起
Serverless自动扩缩

请求驱动的 worker

Docker 镜像 + handler 函数

请求来了自动起 worker、按秒计费、没请求缩到零。线上推理服务的形态——我们的图像生成就是它。

RTX 4090 Flex $1.10/h 折算
Instant Clusters多机多卡

分布式集群

一键拉起

大规模分布式训练用的多机环境,小团队基本用不到。另有 Runpod Hub(开源项目一键部署)和 Public Endpoints——RunPod 自己也开始卖现成模型 API,直接对标 fal 的生意。

🏢

SECURE CLOUD正经数据中心的卡

T3/T4 机房,给生产负载用。官网牌价表展示的就是这一池。

🚗

COMMUNITY CLOUD算力界的顺风车

经审核的第三方算力主机,同卡便宜一到三成,但机器可能被中断。共识:实验用 Community,生产必须 Secure

当前牌价(Secure Cloud,2026-07 官网 pricing 页):

GPUPods 整租Serverless Flex一句话定位
RTX 4090 · 24GB$0.69 / h$1.10 / hSDXL / FLUX 出图性价比主力——我们用的就是这档
RTX 5090 · 32GB$0.99 / h$1.58 / h4090 的接班人
A100 · 80GB$1.39–1.49 / h$2.72 / h上一代训练卡,大显存推理
H100 · 80GB$2.89–2.99 / h$4.55 / h训练 / 大模型推理旗舰

Serverless 单价比整租贵约六成,买的是弹性:像「一天几百张图、请求一阵一阵」的负载,Serverless 一个月几十美元;同样的活整租一台 4090 常开,一个月 $500 起步。存储另计:容器盘 $0.10/GB/月,Network Volume $0.07/GB/月。

Cold Start

官方宣传 FlashBoot「冷启动低于 200 毫秒」——那说的是容器本身。真实世界你的镜像动辄十几 GB(模型权重占大头),首次请求要拉镜像 + 载模型,社区实测几秒到十几秒是常态,大镜像可达分钟级。按「首次很慢、热着以后很快」设计链路,或花钱配常驻 worker。

04
Decision & Landscape

什么时候点菜,什么时候开火

◈ 点菜 → fal.ai

  • 现成模型、要结果、量还不大——零部署成本,十分钟接通
  • 横评多家模型选型——一个 key 全试遍,别逐家开户折腾

✦ 开火 → RunPod

  • 工作流是自己攒的(自定义 ComfyUI 节点、LoRA、私有 checkpoint)→ Serverless。菜单上没有这道菜
  • 训练 / 微调 / 交互式炼丹 → Pods 整租,按小时开关

⤴ 绕过中介

  • 模型已锁定、量大成本敏感时:开源模型自部署摊薄成本
  • 商业模型去厂商官方直调,砍掉聚合层的中介费

两家各自的邻居:

平台和谁一个赛道定位差异点
Replicatefal 的直接对手社区模型生态最广长尾模型多,但冷门模型冷启动明显;fal 胜在快和媒体专注度
Together / Fireworks隔壁赛道开源 LLM 文本推理按 token 计费,和 fal 的图像视频赛道错位
ModalRunPod Serverless 对手代码优先 serverlessPython 装饰器即部署,DX 极佳、价格略高、不租整机
Lambda LabsRunPod Pods 对手开箱即用训练 VM预装 PyTorch,研究向口碑好
Vast.aiCommunity Cloud 对手纯 P2P 算力集市全场最低价,机器质量看运气——RunPod Community 是它的「有审核版」
CoreWeave不同量级企业级 GPU 云几十万张卡 + InfiniBand,服务大厂训练,不是小团队选项
行情背景

GPU 租赁是眼下竞争最惨烈的市场之一:H100 时租从 2024 年底的 $8–10 杀到 2026 年初专业云的 $1.5–2.5。这解释了为什么各家都在往上层「模型 API」卷(RunPod 开 Public Endpoints、fal 冲 $4.5B 估值):卖裸算力越来越不赚钱,卖「结果」才有溢价

05
How We Use Them

一个当厨房,一个当试吃摊

我们不是二选一,而是两家都在用,各干各的活——连起来正好是一条「探索 → 锁定 → 降本」的路径:

FAL.AI
探索
视频模型横评:Seedance / Kling / Veo 多家旗舰同题对照选型——一个 key 全试遍,不用逐家开户充值
RUNPOD
自建
Softie 图像生成:自己攒的 ComfyUI 镜像(SDXL / FLUX + 角色一致性节点,同一个虚拟角色反复出图)跑在 Serverless 上——任何模型 API 菜单上都没有这道菜
直调
降本
锁定后的量产:横评定下模型后,图像量产迁到字节火山方舟官方 API——同款模型比走聚合层便宜

// 聚合平台最大的价值在探索期——它挣的就是你「还没想清楚用哪个模型」时的钱。这没什么不对,但想清楚之后要记得重新算账。

📦

工程形态 · RunPod 链路模型烘焙进镜像

模型权重直接打进 Docker 镜像(约 27GB)→ 推镜像仓库 → Serverless 拉起 worker → 工作流引擎异步提交 + 轮询结果

💤

成本形态 · Scale-to-Zero闲时趋近于零

0–2 个 worker 按需启停,一阵一阵的出图请求下,月账单是几十美元而不是整租的 $500+。

06
Lessons Learned

这些坑我们都真实踩过

Rule #1 · RunPod

Serverless 永远不要挂 Network Volume。教科书方案是「模型放共享网络盘、镜像做小」——我们在三个地区反复实测:endpoint 一绑 Volume,worker 就随机性起不来;解绑立刻正常。团队铁律:模型一律烘焙进镜像,镜像大点(27GB)没关系,稳定压倒一切。

🏷️

RUNPOD · 镜像更新用 digest,别信 latest

推了新镜像、endpoint 还在跑旧代码——latest 标签有缓存。必须用 镜像名@sha256:… 指定唯一版本,改完模板重新保存 endpoint、等旧 worker 过期。「推上去了」≠「跑的是新的」。

🔁

RUNPOD · 配置刷新老 worker 不会自动刷新

改了 endpoint 配置,热着的 worker 继续按旧配置跑。强制生效:先把最大 worker 数调 0 逼停,再调回来。控制台显示的配置 ≠ 线上真实状态,以后者为准。

🌐

RUNPOD · 双域名两个域名各管一套 API

api.runpod.ai 管任务调用,api.runpod.io 管资源管理(GraphQL)。用错返 404 且报错完全看不出原因。排查任务失败先「列最近任务 → 查单个详情」拿真实报错。

💰

FAL · 余额监控把余额当成运维项

预充值余额烧完立刻报错,没有缓冲。接进生产链路那天就要配「余额低于阈值告警」——我们是被真实停工教育后才补的课。

🚧

FAL · 隐形门槛模型各有各的内容政策

同在 fal 菜单上,政策不同:字节 Seedance 内置真人人脸检测,真实照片当参考图直接被拦(face detected),AI 生成人像能通过。横评时把政策差异当成和画质、价格并列的评测项。

通用 · 异步必修先拿号,后取餐

视频生成动辄几十秒到几分钟,同步等结果必超时。fal 的队列 + Webhook、RunPod 的提交 + 轮询,本质都是异步。接任何生成类 API,第一天就按异步设计,别先写同步版再返工。

一句话总括:fal.ai 卖的是做好的菜,RunPod 租的是带灶的厨房——试菜阶段尽管点,独门配方就得自己开火;而吃定了一道菜时,记得去找灶台的主人谈个批发价。