如果说2025年AI视频赛道的关键词是"闭源内卷"——Seedance、可灵、Sora、Veo,一个比一个强,但也一个比一个封闭;那2026年8月,这个格局被彻底打破了。
打破它的,是MiniMax开源的H3。
8月3日,MiniMax正式开源新一代通用视频模型H3——这是他们第一个开源视频模型,也是整个视频生成领域第一个真正意义上的旗舰级开源模型。开源当天,华为昇腾、摩尔线程、AMD、Intel等16家芯片厂商和Hugging Face、ComfyUI等开发社区就完成了Day 0适配。
紧接着,秘塔AI率先接入H3,把768P的价格直接打到了0.09元/秒——生成一段5秒的视频,不到5毛钱。
今天这篇文章,我把H3的核心能力、秘塔的接入情况、实际价格和使用体验整理清楚。不管你是AI视频玩家、内容创作者还是开发者,这篇都值得看完。
一、MiniMax H3到底是什么?
先说结论:H3不是一个普通的开源模型,它是视频生成领域第一次出现"开源即旗舰"的情况。
过去所有主流视频模型——Seedance、可灵、Sora、Veo——无一例外都是闭源的。理由也很直接:视频模型训练成本太高、算力消耗太大,闭源+API计费是最稳妥的商业模式。MiniMax H3打破了这个惯例。
核心规格一览
| 参数 | 规格 |
|---|---|
| 输出分辨率 | 最高2K(默认768P,配合H3-Regenerate-2K可达2K) |
| 输出时长 | 4~15秒 |
| 输出帧率 | 24 FPS |
| 音频 | 32kHz原生立体声(双声道) |
| 宽高比 | 21:9、16:9、4:3、1:1、3:4、9:16等 |
| 支持语言 | 11种(中、英、日、韩、法、德等) |
注意这个音频规格——32kHz原生立体声。不是后期配音,不是TTS叠加,而是模型端到端直接生成的音视频一体内容。声音跟着画面走,情绪、节奏、空间感都是对齐的。
榜单表现
在权威视频模型评测平台Artificial Analysis的榜单上,截至H3发布当日(2026年7月31日):
一个开源模型,上线即登顶。这在视频生成领域还是头一次。
二、H3的核心能力:不只是"生成素材",而是"直接出片"
如果只用一句话概括H3最大的突破,我会说:它把"后期"这件事,装进了模型里。
过去的AI视频模型,交付的是一段"素材"——没配音、没字幕、没转场、没包装。你拿到之后还得拖进PR或剪映,一步一步接完剩下的活。
H3不一样。它把剪辑逻辑、字体排版、转场设计、节奏把控、背景音乐、视觉特效全部端到端集成到了模型内部。输入一段文本描述,它直接还你一个可以一键发布的成品。
几个让我眼前一亮的技术亮点
① 复杂文字保持能力
影视片头的中英文标题、动态海报上的品牌logo、UI动效里的字幕——H3能让文字真正参与视觉构图。文字会贴合物体的透视,接受场景光照方向,跟随镜头运动,保持形状不畸变。
这不是简单的"在视频上叠字",而是模型理解了整个场景之后的产物。比如一个logo放到玻璃杯上,模型理解玻璃的折射;放到墙上,理解墙的曲率和纹理。这已经超出了"生成字体"的边界。
② 全模态参考输入
H3支持文本、图片、视频、音频的混合输入。具体来说:
- 最多9张图片 + 3段视频 + 3段音频
- 可以给一张人物参考图 + 一段镜头运动参考视频 + 一段歌声参考音频,让模型"按参考视频的运动方式、用参考音频的歌声、让图里的人物唱歌"
- 这种跨模态复合参考能力,此前基本是闭源旗舰的专属
③ 自研H3-VAE:效率碾压
同样一段视频,H3的自研VAE用更少的数据块表达出来,序列长度直接省4倍。训练更便宜,推理也更快。
④ 2K不是"猜"出来的
行业里大部分模型输出2K/4K的思路是先生成低分辨率,再用超分模块放大。本质是在"猜"缺失的细节,放大后小字、纹理经常糊或变形。
H3的做法是:把768P结果当作参考,连同原始多模态上下文一起输入模型,复用H3已有的生成能力,恢复低清视频里已经不可见但上下文里仍然存在的信息。所以H3在复杂文字场景不翻车,底层原因就在这里。
模型架构简述
完整的H3系统由三个模块组成:
H3-Context-IR
预处理与编排层,将多模态输入整理为结构化中间表示
H3-Regenerate-2K
2K再生成模块,结合768p结果和原始上下文补回高分辨率细节
Hugging Face上开源的是H3-Base,包含FL2VA(首尾帧生成)和Ref2VA(全模态参考生成)两个检查点。INT8量化版配合24GB单卡即可运行。
完整的2K全流程,目前仍需本地H3-Base + MiniMax API的混合方案。
三、秘塔AI接入H3:开箱即用,最低5毛钱一段视频
模型再好,部署门槛一直是挡在普通创作者面前的现实问题。
找项目地址、看安装文档、准备显卡环境、装依赖、调参数、排查报错……对于内容创作者来说,这套流程跟创作本身是割裂的。更何况,很多人根本没有一张能跑动大模型的显卡。有用户实测,4090本地跑10秒512×960的视频,要等一个小时。
这就是秘塔AI接入H3的意义——把部署门槛直接抹掉。
秘塔AI的H3使用体验
打开秘塔AI官网(metaso.cn),找到"视频生成"入口点进去,H3的生成页面就在眼前。不用研究参数配置,不用啃安装文档,直接在prompt框里输入提示词就能生成。
支持的生成模式包括:
- 文生视频:输入文字描述直接生成
- 图生视频:上传首帧/尾帧图片,AI补全中间动作
- 多参考生成:图片+视频+音频混合输入
对于更重度的玩家,秘塔也支持ComfyUI工作流接入,满足精细化节点调节和流程编排需求。
价格:真的便宜
10秒视频 ≈ 0.9元
10秒视频 ≈ 1.5元
作为对比,MiniMax H3官方API的2K定价是0.8元/秒。秘塔在2K分辨率上的价格只有官方的不到1/5,768P更是压到了1/10以下。
换算成体感:一瓶矿泉水的钱,能生成一条10秒的2K高清视频。
而且API价格与线上保持一致,接口兼容官方格式。想接入ComfyUI工作流的开发者,也可以直接调用,不用额外折腾配置。
四、本地部署 vs 云端调用:怎么选?
| 方案 | 适合谁 | 硬件要求 | 生成速度 | 成本 |
|---|---|---|---|---|
| 本地部署(H3-Base) | 开发者、技术玩家、数据隐私需求 | 24GB+显存(INT8量化) | 480P 5秒约5-10分钟 | 电费+硬件折旧 |
| 秘塔AI在线调用 | 内容创作者、不想折腾部署 | 能上网就行 | 15秒视频约3分钟 | 768P: 0.09元/秒 2K: 0.15元/秒 |
| 官方API | 集成到自己产品的开发者 | 无 | 取决于调用量 | 2K: 0.8元/秒 |
一个现实的对比:有用户实测4090本地跑10秒视频要一个小时,而秘塔在线生成同样15秒视频只需3分钟。对于不以部署为乐的创作者来说,云端调用的效率优势是碾压级的。
五、H3意味着什么?视频生成的"DeepSeek时刻"
回头看这次MiniMax H3开源,让我想到了2024年底DeepSeek V3在语言模型领域做的事情——用开源+低价的组合,把整个行业的价格锚点拉下来。
当时的情况是:DeepSeek开源后,一众闭源模型被迫降价,大模型价格战全面打响。
现在视频生成领域正在重演同样的剧本:
视频生成的四个转折点
- 旗舰模型首次开源:H3证明了开源模型可以追上闭源旗舰水平
- 价格被打到地板:秘塔把768P压到0.09元/秒,5毛视频的时代来了
- 部署门槛被平台抹平:从"需要显卡+环境配置"到"打开网页就能用"
- 开发者生态Day 0启动:16家芯片厂商+ComfyUI等平台首日适配
过去半年,行业里讨论"电影级"视频生成时,主流模型的默认分辨率还在1080p水平。H3直接把默认输出拉到2K,同时把单价压到同级别产品的1/3甚至更低。
对于内容创作者来说,这意味着:
- 试错成本大幅降低——不满意可以多次重试,不用担心烧钱
- 创意验证更快——从想法到成片,几分钟搞定
- 不再被硬件绑架——不需要买显卡也能用上旗舰模型
六、写在最后
2026年8月,可能是AI视频生成领域的一个转折点。
MiniMax H3用开源证明了一件事:旗舰级视频模型不一定要锁在围墙里。秘塔AI用0.09元/秒的价格证明了另一件事:好模型也可以便宜到人人用得起。
当"开源+低价+零门槛"这三个条件同时成立,视频生成就不再是少数人的特权,而是每个有想法的人都能参与的事情。
如果你还没试过,建议去秘塔AI上跑一条看看——5毛钱的试错成本,足够你感受一下2026年AI视频的真实水平了。
有问题欢迎留言交流。
转载请注明:MiniMax H3开源视频模型深度解析:秘塔AI接入,768P仅0.09元/秒,AI视频进入几分钱时代 | NavCN

