BILLING · 按结果计费图像按张,视频按秒
成本和产出一一对应,不用关心 GPU 利用率——生成 100 张图的账单就是 100 × 单价。
fal.ai 是餐厅——一千多道现成模型按份收钱;RunPod 是出租厨房——带 GPU 的灶台按小时租给你。同一个需求「生成一张图」,两家是完全不同的买法。
// 面向全员 · 不需要会写代码 · 主线是团队图片 / 视频生成链路的真实选型
所有「AI 生成」的成本,最后都落在 GPU 上。区别只在于你站在离 GPU 多远的地方付钱——离得越远越省心,离得越近越自由。
调 API → 传提示词 → 拿回图 / 视频
按「每张图 / 每秒视频」计费。GPU、模型部署、扩缩容全部不可见。点菜:菜单上有的,十分钟接通。
租 GPU 机器 → 装自己的模型 → 自己跑
按「GPU 每秒 / 每小时」计费。生成什么、怎么生成全由你。开火:独门配方只能自己做。
往下每一层,你多担一层责任、也多拿一层控制权:
| 层次 | 代表 | 你负责 | 平台负责 |
|---|---|---|---|
| 模型 API | fal.ai · Replicate | 写提示词、调 API | 模型、GPU、部署、扩缩容 |
| Serverless GPU | RunPod Serverless · Modal | 打包自己的模型进 Docker 镜像 | GPU、按请求启停、排队 |
| 整租 GPU | RunPod Pods · Lambda · Vast.ai | 模型、环境、启停、利用率 | 只管交出一台带卡的机器 |
这和 Fly.io 那篇讲的「全托管 PaaS vs 租 VPS」是同一个故事在 GPU 世界的重演:fal 之于 RunPod ≈ Vercel 之于 Fly.io——只是这里的机器多了一块几万块钱的显卡,账单也放大了一个量级。
fal.ai 自我定位「面向开发者的生成式媒体平台」:把图像、视频、音频、3D 生成模型——官方口径超 1,000 个——包成同一套 API。FLUX、Kling、Veo、Seedance、Wan 全在菜单上,一个账号一个 key,今天调字节的模型、明天换 Google 的,代码几乎不用改。2025-12 完成 Sequoia 领投 D 轮 $140M,估值 $4.5B,一年翻三倍,是这条赛道的头部玩家。
成本和产出一一对应,不用关心 GPU 利用率——生成 100 张图的账单就是 100 × 单价。
所有模型天生支持异步队列 + Webhook:提交任务立刻返回,生成完回调你的接口——长视频生成必须这么干。
Python / JS 官方 SDK;网页 Playground 不写代码先试效果、看实时标价,横评模型时效率极高。
几个当前牌价感受一下量级(2026-07 官网 pricing 页):
| 模型 | 类型 | 牌价 | 换算 |
|---|---|---|---|
| FLUX.2 [dev] | 文生图 | $0.012 / MP | 一张 1024×1024 约 1 毛钱人民币 |
| Seedream V4 | 文生图 | $0.03 / 张 | 一张约 2 毛 |
| Wan 2.5 | 视频 | $0.05 / 秒 | 5 秒一条约 1.8 元 |
| Kling 2.5 Turbo Pro | 视频 | $0.07 / 秒 | 5 秒一条约 2.5 元 |
| Kling O3 Standard | 视频 | $0.084–0.112 / 秒 | 5 秒含音频约 4 元 |
| Veo 3 | 视频 | $0.40 / 秒 | 5 秒一条约 14 元——旗舰价 |
RunPod 自我定位「AI Developer Cloud」:2022 年成立,2026-06 完成 Summit Partners 领投 $100M A 轮,估值 $1B,宣称开发者超百万、31 个地区有机房。它卖的东西很纯粹——带 GPU 的算力,三种形态:
按需 / 抢占式(Spot)
整租一台带卡的机器,拿到就是你的。适合训练、微调、交互式实验——开着 ComfyUI 慢慢调。
Docker 镜像 + handler 函数
请求来了自动起 worker、按秒计费、没请求缩到零。线上推理服务的形态——我们的图像生成就是它。
一键拉起
大规模分布式训练用的多机环境,小团队基本用不到。另有 Runpod Hub(开源项目一键部署)和 Public Endpoints——RunPod 自己也开始卖现成模型 API,直接对标 fal 的生意。
T3/T4 机房,给生产负载用。官网牌价表展示的就是这一池。
经审核的第三方算力主机,同卡便宜一到三成,但机器可能被中断。共识:实验用 Community,生产必须 Secure。
当前牌价(Secure Cloud,2026-07 官网 pricing 页):
| GPU | Pods 整租 | Serverless Flex | 一句话定位 |
|---|---|---|---|
| RTX 4090 · 24GB | $0.69 / h | $1.10 / h | SDXL / FLUX 出图性价比主力——我们用的就是这档 |
| RTX 5090 · 32GB | $0.99 / h | $1.58 / h | 4090 的接班人 |
| A100 · 80GB | $1.39–1.49 / h | $2.72 / h | 上一代训练卡,大显存推理 |
| H100 · 80GB | $2.89–2.99 / h | $4.55 / h | 训练 / 大模型推理旗舰 |
Serverless 单价比整租贵约六成,买的是弹性:像「一天几百张图、请求一阵一阵」的负载,Serverless 一个月几十美元;同样的活整租一台 4090 常开,一个月 $500 起步。存储另计:容器盘 $0.10/GB/月,Network Volume $0.07/GB/月。
官方宣传 FlashBoot「冷启动低于 200 毫秒」——那说的是容器本身。真实世界你的镜像动辄十几 GB(模型权重占大头),首次请求要拉镜像 + 载模型,社区实测几秒到十几秒是常态,大镜像可达分钟级。按「首次很慢、热着以后很快」设计链路,或花钱配常驻 worker。
两家各自的邻居:
| 平台 | 和谁一个赛道 | 定位 | 差异点 |
|---|---|---|---|
| Replicate | fal 的直接对手 | 社区模型生态最广 | 长尾模型多,但冷门模型冷启动明显;fal 胜在快和媒体专注度 |
| Together / Fireworks | 隔壁赛道 | 开源 LLM 文本推理 | 按 token 计费,和 fal 的图像视频赛道错位 |
| Modal | RunPod Serverless 对手 | 代码优先 serverless | Python 装饰器即部署,DX 极佳、价格略高、不租整机 |
| Lambda Labs | RunPod Pods 对手 | 开箱即用训练 VM | 预装 PyTorch,研究向口碑好 |
| Vast.ai | Community Cloud 对手 | 纯 P2P 算力集市 | 全场最低价,机器质量看运气——RunPod Community 是它的「有审核版」 |
| CoreWeave | 不同量级 | 企业级 GPU 云 | 几十万张卡 + InfiniBand,服务大厂训练,不是小团队选项 |
GPU 租赁是眼下竞争最惨烈的市场之一:H100 时租从 2024 年底的 $8–10 杀到 2026 年初专业云的 $1.5–2.5。这解释了为什么各家都在往上层「模型 API」卷(RunPod 开 Public Endpoints、fal 冲 $4.5B 估值):卖裸算力越来越不赚钱,卖「结果」才有溢价。
我们不是二选一,而是两家都在用,各干各的活——连起来正好是一条「探索 → 锁定 → 降本」的路径:
// 聚合平台最大的价值在探索期——它挣的就是你「还没想清楚用哪个模型」时的钱。这没什么不对,但想清楚之后要记得重新算账。
模型权重直接打进 Docker 镜像(约 27GB)→ 推镜像仓库 → Serverless 拉起 worker → 工作流引擎异步提交 + 轮询结果。
0–2 个 worker 按需启停,一阵一阵的出图请求下,月账单是几十美元而不是整租的 $500+。
Serverless 永远不要挂 Network Volume。教科书方案是「模型放共享网络盘、镜像做小」——我们在三个地区反复实测:endpoint 一绑 Volume,worker 就随机性起不来;解绑立刻正常。团队铁律:模型一律烘焙进镜像,镜像大点(27GB)没关系,稳定压倒一切。
推了新镜像、endpoint 还在跑旧代码——latest 标签有缓存。必须用 镜像名@sha256:… 指定唯一版本,改完模板重新保存 endpoint、等旧 worker 过期。「推上去了」≠「跑的是新的」。
改了 endpoint 配置,热着的 worker 继续按旧配置跑。强制生效:先把最大 worker 数调 0 逼停,再调回来。控制台显示的配置 ≠ 线上真实状态,以后者为准。
api.runpod.ai 管任务调用,api.runpod.io 管资源管理(GraphQL)。用错返 404 且报错完全看不出原因。排查任务失败先「列最近任务 → 查单个详情」拿真实报错。
预充值余额烧完立刻报错,没有缓冲。接进生产链路那天就要配「余额低于阈值告警」——我们是被真实停工教育后才补的课。
同在 fal 菜单上,政策不同:字节 Seedance 内置真人人脸检测,真实照片当参考图直接被拦(face detected),AI 生成人像能通过。横评时把政策差异当成和画质、价格并列的评测项。
视频生成动辄几十秒到几分钟,同步等结果必超时。fal 的队列 + Webhook、RunPod 的提交 + 轮询,本质都是异步。接任何生成类 API,第一天就按异步设计,别先写同步版再返工。