【学习笔记】MiniMax H3 Max:fal 把开源 H3 后训练成"生成快过播放"的视频模型(信息汇总)

18 min

最近几天圈子里流传一个说法:“MiniMax 出了个 H3 Max,速度极快。“我把中英文信息翻了一遍,先把最容易误解的一点说清楚:H3 Max 不是语言模型,而是视频生成模型——它是推理平台 fal 基于 MiniMax 刚开源的全模态生成模型 H3 后训练(post-train)出的高速版本,2026 年 8 月底发布。它出圈的原因只有一个:生成比播放还快。一段 5 秒 768p 视频,约 3 秒就出片,官方口径是约 35 倍于 MiniMax 自家 H3 端点的吞吐量。

这篇笔记是纯信息汇总(我本人没有实测),按”一手/二手”分层记录数字,最后给价格、许可证边界和落地测算。先说结论:

H3 Max = 开源 H3 的权重 + fal 的新训练数据 + 与模型协同设计的专用推理栈。质量没垮(第三方榜单图生视频第一),速度成了(短视频快过播放),价格也没涨(MiniMax 平台上与基础版 H3 768P 同价,$0.08/秒)。它把视频生成从”提交后等几分钟”变成了”可以快速试错的工具”——但对”24 小时 AI 直播频道”这类想象,成本、连贯性、审核三道坎都还在。

一、H3 Max 是什么:后训练 + 推理协同设计

先把几方关系理清楚,这是中文社区传播里最混乱的部分。

H3 Max 是谁做的? fal 官方公告 的口径:由 fal Research 后训练、fal 推理团队做速度优化,基于的是 MiniMax 开源的 H3 权重。但注意,这不是”第三方魔改打脸官方”的单方面故事——MiniMax 官方 X 账号发文称 “Yesterday, we launched H3 Max. We post-trained MiniMax H3 for stronger prompt adherence and visual quality, while co-designing the inference…”,而且 MiniMax 自家平台的模型列表定价页都直接上架了 H3 Max。中文科技媒体也普遍称这是 MiniMax 与 fal 的联合发布。所以更准确的说法是:双方合作,模型能力侧(后训练)和推理服务侧(fal 的老本行)各出所长

后训练做了什么?(以下为一手来源 fal 公告的转述)

  • 加了大量新训练数据,主打提示词遵循视觉质量两个方向;
  • 明确不走传统”步数蒸馏求平价”的路线——fal 的原话是:传统蒸馏目标是达到与基模持平的质量,而他们”aim for a better model at much faster speed”(要一个更快且更好的模型);
  • 训练过程中持续做三维度的人头对头偏好评测(整体质量、提示词理解、美学),防止单一总分掩盖某个维度的回归。

推理侧做了什么? fal 的推理团队(做 diffusion 服务四年)在模型还在训练时就开始协同设计(co-design)推理栈:每个优化只有在内部质量排名不下降时才保留,最终得到的是一个”围绕 H3 Max 专门优化的服务栈,而不是跑着 H3 Max 权重的通用服务栈”。这句话很关键——它解释了为什么同样的权重,官方端点和 fal 端点差出 35 倍:差距一半在模型后训练,一半在服务工程

官方规格(fal 产品页,一手):

项目规格
模型类型视频生成(文生视频 / 图生视频),音画同步输出原生立体声
分辨率480P / 768P(无 2K——2K 是基础版 H3 的能力)
时长5–15 秒,24 fps
速度5 秒 768p 视频端到端 3 秒内出片,其中后端推理仅约 2.5 秒
获取渠道fal(Playground / fal Agent / API)与 MiniMax 平台(API)

二、速度到底多快:把数字分层

“极快”是这次出圈的标签,但流传的数字从 15 倍到 50 倍都有,必须分层看:

口径数字来源层级
fal 官方:对 MiniMax 官方 H3 端点的吞吐量35 倍一手(fal 公告
fal 官方:对比质量相近的其他模型平均快约 15 倍一手(同上)
端到端延迟5 秒 768p 视频约 3 秒生成(后端推理约 2.5 秒)一手(fal 产品页
Reddit 标题 / levelsio 推文“近 50 倍于基座模型”、“50x faster but still maintains quality”二手(r/singularitylevelsio
单次演示15 秒视频 9 秒生成二手单例(KuCoin 快讯

两个降温的事实,来自 AI邮报的冷静分析(二手但做了交叉核对):

  1. 只有短片”快过播放”。按官方口径,15 秒视频约需 15 秒生成——“快过播放”只在 5 秒左右的短片段成立,社群里”15 秒只要 9 秒”属于单次成功示范,不是可重现规格;
  2. “快过播放”并非首例。LTX-Video(Lightricks,2024)早在 H100 上就记录过 5 秒视频约 2 秒生成。H3 Max 的意义不在绝对速度纪录,而在把这个速度和第一梯队的质量、原生音频同时拿到

还有一层社区质疑值得记录(r/StableDiffusion 讨论,二手):有人认为 35 倍里相当一部分来自专用机架 + 推理工程优化,本地用户拿到权重也复现不了这个速度。fal 声称有意开放 H3 Max 权重(Artificial Analysis 转述),截至本文写作尚未放出——“权重会不会放、放了能不能跑”是悬着的问号。

三、质量没垮吗:第三方榜单与两条加速路线

速度之外大家最关心的是”是不是糊质量换速度”。证据分两层:

第三方榜单Artificial Analysis,发布当天即测评):H3 Max 首发登顶图生视频(含音频)榜第一(Elo 约 1,205),文生视频榜第三(约 1,235,落后于 Wan 3.0 和 Gemini Omni Flash)。注意这与 fal 自评”三个维度全部第一”(对比 12 个模型、Bayesian Elo 加权、含置信区间,对手包括官方 H3 端点、Wan 3.0、Seedance 2.5、Kling 3、Veo 3.1)存在口径差——自评测第一是”人头对头胜率”,AA 榜是另一套 Elo 体系。分层结论:质量第一梯队可确认,“全面碾压”存疑,文生视频还不是第一。

加速路线对照是理解”35 倍”含金量的关键。七牛云的实测文章(一手实测,2026-08-31)把两条路线摆在了同一张桌上:

路线做法实测结果
fal(H3 Max)后训练 + 专用推理栈协同设计官方口径约 35 倍吞吐
LMSYS 开源侧8×H200 上 VSA + CUDA Graph 等组合优化1.85–1.95 倍(质量无损),组合优化最高 6.24 倍
FastVideo”FastH3 v1”4 步/8 步激进加速约 14 倍,但质量明显下降;12 步才能追平质量,此时只剩约 2.6 倍
社区sparse attention约 2.5 倍

这张表说明:纯推理优化做到 2–6 倍是开源侧的天花板,14 倍以上就得牺牲质量;fal 的 35 倍是”重新训过的模型 + 定制服务栈”叠出来的,两边缺一不可。

顺带记录一段未能完全核实的传闻(诚实起见单独分层):B 站有个 4 万多播放的视频标题称”MiniMax 官方回应 fal 公开点名批评:FastH3 的速度全靠糊质量”。结合七牛云实测看,“速度全靠糊质量”这个说法针对的应该是 FastVideo 的 FastH3 激进加速版(4/8 步版确实掉质量),而不是 fal 的 H3 Max——后者走的是另一条路线且质量登榜。“点名批评”的具体经过我没能找到一手出处,存疑记录。

四、价格与获取渠道

MiniMax 官方平台定价(定价页,一手核对,按输出秒计费):

模型分辨率价格(美元/秒)备注
MiniMax-H3-Max480P$0.05仅文生视频 / 图生视频,只按输出计费
MiniMax-H3-Max768P$0.08与基础版 H3 768P 同价
MiniMax-H3(基础版)768P$0.08另有视频编辑能力
MiniMax-H3(基础版)2K$0.13需要高分辨率时的选择
H3-Regeneration768P→2K$0.05超分管线

值得注意的渠道差价:fal 上 H3 Max 为 $0.08/秒(发布首周 5 折,fal 定价页),而 fal 上的基础版 H3 同分辨率只要 $0.06/秒AA 转述)——同一个 Max,在 MiniMax 平台不加价、在 fal 平台反而比基础版贵,选渠道前值得算一下账。国内平台(platform.minimax.cn)检索到的 H3 Max 价格为 480P ¥0.33/秒、768P ¥0.50/秒(搜索结果转述,未直接核对页面)。

免费尝鲜额度(AI邮报整理):fal 公开页每日 5 次、每次 5 秒;登录 sandbox 另有 5 次、最长 15 秒——想直观感受”3 秒出片”零成本。

五、底座:MiniMax H3 是个什么模型

要理解 H3 Max 为什么能这么玩,得看底座 H3 本身(H3 Max 发布于 2026 年 8 月底;H3 则是 7 月 31 日发布、8 月 3 日开放权重):

  • 定位:MiniMax 的开源全模态生成系统——理解文本/图像/视频/音频输入,生成最高 2K 分辨率、15 秒、原生立体声的视频。注意它不是语言模型:MiniMax 的语言模型是另一条 M 系列(M3,主打 Agent/编程,1M 上下文),H 系列专做生成,官方口径是两条产品线并行。
  • 架构HF 模型卡,一手):33B 参数的稠密单流 Omni-Transformer,其中约 13B 参数位于 AdaLN 相关分支——这部分推理时可预计算缓存、不常驻显存。权重以 diffusers pipeline 形式发布于 Hugging FaceGitHub,ComfyUI 官方 Day-0 支持,还有 Intel Day-0 硬件适配。
  • 成绩:视频编辑能力登顶(Artificial Analysis 有声视频编辑榜第一,Elo 1,130,InfoQ 报道的 Reddit 答疑);基础版 API 定价 0.8 元/秒(新京报),约为同类旗舰的三分之一。
  • 许可证边界MiniMax H3 Community License,务必注意):非商业使用免费;年营收低于 2,000 万美元的组织可免费商用但需显著署名,超过需邮件申请;地域排除美国、英国、欧盟、韩国。HF 上标注 license: other,不是 OSI 认证的开源协议。另外据 AI邮报 FAQ,完整 2K 管线的部分功能仍需连接 MiniMax 官方服务。

H3 Max 的故事本质上是一场开源权重的第二春:MiniMax 把权重放出来,fal 用自己的后训练和服务工程把官方端点”卷”出了 35 倍差距,最后官方干脆联合上架。这是开源生态最理想的正循环剧本——前提是你接受它的许可证限制。

六、能干什么、边界在哪

AI邮报的分析(自述立场”中性偏多”)把落地边界讲得比较透,我直接沿用它的框架:

三道坎

  1. 成本:$0.08/秒看着便宜,换成连续生产就是另一回事——1 小时约 $288,24 小时约 $6,912,30 天不间断约 $207,360,且不含重抽(生成失败/不满意重试,实际成本可能翻倍)、脚本、串流、存储与审核;
  2. 连贯性:模型非原生串流,现有做法是”一段接一段预缓冲”,各段独立生成时角色脸、服装、场景、声音都可能变,需要自己维护尾帧、角色参考与场景状态;
  3. 审核:直播场景数秒内公开,需要 Prompt 限制、敏感内容检查、人工中止与安全备援片段;模仿知名节目/角色/声音还有知识产权风险。

规格边界:480P/768P 封顶、单次 5–15 秒——要 2K 或精细文字的高阶广告场景,还是得用基础版 H3 走 2K 管线。

作者的建议(我认同):别一上来就做”永不落幕的 AI 频道”,先做 5–10 分钟、范围受控的互动节目 MVP 验证观众参与度。H3 Max 的真正价值不是”AI 电视”,而是把视频生成从”提交后等几分钟”变成可快速试错的创作工具——3 秒出片意味着改一版提示词的成本趋近于零,这对广告、电商、UI/UX 概念原型的迭代节奏是质变。

七、我的小结

  1. 速度是真的,但要看清口径:35 倍是”对官方端点的吞吐量”(一手),50 倍是社区传播的放大(二手),第三方榜单确认的是质量第一梯队 + 图生视频第一,而非全面第一;
  2. 35 倍的构成比数字本身有意思:开源侧纯推理优化天花板约 2–6 倍,激进蒸馏到 14 倍就掉质量;fal 用”后训练 + 协同设计服务栈”把速度和质量同时保住,这个方法论(模型和服务栈一起改)比 H3 Max 这个模型更值得记住;
  3. 对用户最实际的:MiniMax 平台上 H3 Max 与基础版 768P 同价,短视频迭代选 Max,要 2K/视频编辑选基础版,两条路都不贵;
  4. 悬而未决:H3 Max 权重尚未放出,放出后本地能否复现速度存疑;H3 的 Community License 有营收门槛和地域排除,商用前必须细读。

资料来源

一手来源:

二手来源: