AI 日报hiw3c.com

吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞

量子位 www.qbitai.com 网页快照

吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞

闻乐 发自 凹非寺 量子位 | 公众号 QbitAI

所以MiniMax前脚刚把H3开源,后脚各种工作流、ComfyUI节点、垂直优化玩法就已经冒了出来。

这不,一站式AIGC创作平台 RunningHub 就盯上了一个大家都特《急急急》的事儿:

灵感一上头,创意改起来只要十几秒,下一版都已经在脑子里剪完了,结果屏幕上的这一版还在转……

同样生成5秒、1344×768的视频,在4张RTX 6000D上,原始BF16 50步方案耗时 348.8秒,差不多6分钟 。

RunningHub H3 Lightning完整加速之后,只需要 28.7秒 。

好家伙,前后约 12倍提速 ,生成耗时减少约92%,却依旧能保留BF16数值精度。

现在,RunningHub已经把整套玩法放GitHub上开源了,任何创作者都能开箱即用!

(https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/)

快12倍的H3是啥体验

不光是5秒视频,就算是15秒、双参考图,RunningHub H3 Lightning依旧能给你猛猛提速。

在8张RTX 6000D环境下,让H3做一个15秒、分辨率768×1344的视频,纯文字生成大约需要48秒、双参考图生成约73秒。

而且在RunningHub H3 Lightning这儿,AI加速可不等于质量劣化。

场景放在沙漠,一个女越野摩托车手原地起步,随后高速冲上沙丘,腾空、落地,再接一个大幅甩尾。

落地的时候车身有明显的下沉和回弹,骑手的重心也跟着往下压了一下,还有尘土的飞扬看着也挺真实。

少年从草地上起身,直接向山坡前方奔跑;金毛也得跟着起来,一边跑一边跳;少年中途还要张开双臂、转身继续跑。

从坐着到起身,再到迈步加速,动作之间有比较明显的衔接;金毛也没有沦为一张跟着人物平移的贴纸,自己完成了起身、奔跑和跳跃。

少年的黄色外套、蓝色裤子、黑色头发这些主要特征一直都在,金毛的体型和毛色也没有跑到后半段突然换了个品种。

当然了,你要是真盯着看也还是能挑出毛病。狗在快速跳跃时,四肢动作偶尔会有点“硬”,但是倒也不会特别出戏。

少年得站起来撑伞,在草地上跑,再突然停下转一圈;金毛继续绕着他跑,还得从旁边跳过去。

对很多创作者来说,创意落地、试错的时间成本都降低了,也不用因为漫长等待就砍掉很多一闪而过的想法。

那么问题来了, 不降BF16精度,也不开挂顶级数据中心算力,RunningHub抠出来的时间,到底是从哪儿省出来的?

人人都能用,本地可部署

先看看哪里算得太多,再看看哪里算得太慢,最后看看几张GPU之间有没有时间浪费在“互相等”上。

把文字或者图片变成视频需要经过多轮计算,画面才会逐渐从噪声中成形,这个轮次叫生成步数。

原始H3推理默认50步,每一步背后都有一轮实打实的计算,步数越多,GPU自然就得干得越久。

简单点说就是让H3经过后训练之后,学会用更少的步数把视频做出来,还得在不丢画质的前提下完成。

同样使用4张RTX 6000D生成5秒视频,换成RH后训练加速模型的9步测试方案之后,时间直接缩短到了43秒。

RunningHub接着想解决的是,剩下这些必须完成的计算,还有没有地方能继续省时间?

这次一口气上了三个技术组合, SageAttention2、Cache-DiT和torch.compile 。

谁和谁相关、前后画面怎么联系、不同信息怎么共同影响最终结果,这些注意力计算本身就是推理过程中相当吃算力的一环。

视频生成前后多个计算步骤之间存在可以复用的信息,如果有些中间结果已经算过,后面的步骤就没必要每次都从头再来。

最后还有torch.compile,它会对计算过程进行 编译优化 ,让GPU执行这些操作时更加顺畅,减少一些原本零散的调度和执行开销。

当RH后训练加速模型和这些算子、缓存、编译优化叠到一起,该跑快的跑快,该复用的复用,该捋顺的捋顺,刚才压到43秒的生成过程又被继续压到了28.7秒。

八个人当然比一个人手多,可如果任务分配不合适,每个人刚干两下就要停下来等别人递东西,A等B,B等C,最后时间全耗在互相交接上。

GPU之间需要不断交换数据,而在没有NVLink高速互联、主要依靠PCIe通信的环境里,卡间通信的成本尤其不能忽略。

RunningHub这次专门针对这种环境,把不同的多卡并行方式拉出来重新测了一遍,最后选中的组合是 TP2+Ulysses4 。

在8张RTX 6000D、PCIe连接且没有NVLink的环境下,TP2+Ulysses4相比TP4+Ulysses2, 速度快约12%,同时减少约14GiB显存占用 。

SageAttention2、Cache-DiT和torch.compile继续提高剩余计算的执行效率;

最后,RunningHub把这些方法全部整合进SGLang multimodal_gen推理引擎,由它把模型生成、多卡协同和各种加速组件真正组织到一起。

现在AI行业的各种性能数字已经卷得飞起,只要舍得堆顶级GPU、高速互联和数据中心,把模型跑得飞快并不稀奇。

H3 Lightning特意绕开了“超能力解法”,针对的就是无NVLink的PCIe多卡环境,RTX 6000D也是公开可购买的专业GPU规格。

也就是说,RunningHub从一开始针对性优化的,就是一种更贴近工作室和企业团队实际部署的多卡环境。

当然了,如果你的预算没上限,用B300的卡配合这个方式,出片速度能直接提升至秒级。

从环境安装、模型下载,到服务启动和推理测试,H3 Lightning整个本地部署流程都公开了。

开发者也可以结合公开的社区加速LoRA,再配上前面提到的注意力优化、计算缓存和多卡并行,在自己的机器上重新跑一遍。

没有多卡服务器、不想研究环境配置的创作者, 直接在RunningHub上点开H3 Lightning也能用 。

顶级算力被垄断,RunningHub选了创作者够得着的那条路

有人会拿开源底座继续做后训练,把优化后的能力跑在顶级数据中心集群上,再封装成API提供给用户。

用户不需要关心背后的GPU和工程优化,按调用付费就能直接获得结果,这当然是一种很成熟的商业路径。

开发者自己拥有硬件、自己部署模型,围绕自己的工作流继续改,优化方法又能被下一批开发者拿去复现和迭代。

模型出来之后,平台第一时间把它接进来,让创作者不用先研究一大堆部署问题,就可以上手尝试新模型。

有人拿H3做电商内容,有人拿去做 短剧、漫剧 ,有人研究 声音克隆、动作克隆和音频驱动 ,还有人继续把自己的玩法封装成新的工作流。

TA发布的MiniMax H3·电商多参生视频工作流,只需要把商品、模特、场景一股脑塞进去,再简单说说卖点——

H3就能自己琢磨人物该在哪儿、商品怎么露出、场景怎么搭,最后直接给你一条完整电商广告。

自打H3上线以来,RunningHub平台上已经有上千名创作者,围绕它开源了近万条创意工作流。

其实这也是开源模型的乐趣,一个人解决一点问题,最后整个生态能用的东西就越来越多。

而H3 Lightning相当于RunningHub再进一步,开始把自己积累的工程能力反过来贡献给H3,直接解决推理效率的问题。

如果只看RunningHub,一个AIGC创作平台突然跑去研究后训练、算子优化和多卡并行,多少有点跨界。

当时的核心矛盾是游戏、图形、高性能数字内容体量越来越大,如何让这些负载稳定、高速地运行起来。

GPU容器调度、图形虚拟化、实时流媒体、大规模云渲染,海马云的整套能力体系都是围绕这个目标打磨的。

时至今日,海马云已经在国内建设60余个边缘节点,支撑超过2000万月活用户的智算服务。

于是海马云面对的命题也随之从「高性能内容怎么跑」,进一步转向了「AI能力如何调用,又如何高效落地」。

计算对象从云渲染到AI推理,但这也恰好让海马云这家 原生AI公司 十余年的技术积累有了更大的发挥场景。

RunningHub H3 Lightning,是海马云 「GPU工程能力」 在AI时代的一个新落点,补齐的也是开源模型从权重到生产力之间缺失的环节。

谁能在模型开源之后,最快把它接进真实环境、优化到生产可用,再把这些能力持续回馈给社区。

而H3 Lightning推理优化,则是在模型跑通之后,继续攻克速度、成本与硬件门槛,把单次试玩的内容生成,升级为可稳定复用的批量生产力。

GitHub仓库:https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning/

新版GPT Image 2.5已经能伪造GPT-6发布会了 2026-09-04

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代 2026-09-04

Coding不再是程序员专属!阿里Qoder这波有点绝 2026-08-29

AI4S开始进入「项目时代」:紫东太初把AI从做Task推向做Project 2026-08-25

相关阅读

实测腾讯AI文生图!王者荣耀画风一键直出,小程序就能玩

中国AIGC最值得关注企业&产品榜单揭晓!首份应用全景图谱发布

AIGC基于文本生成音乐,现在压力来到配乐行业这边|Github

李开复麾下大模型公司零一万物上线,数十位核心成员就位

抖音CEO离任,奔赴AIGC视频新风口

狸谱App负责人一休:从“叫爸爸”小游戏到百万月活AI爆款,社交传播有这些底层逻辑丨中国AIGC产业峰会

热门文章

陶哲轩吐槽GPT-6孪生素数新突破:令人无语的一幕

姚班校友主导,Claude攻克费马大定理首个完整形式化证明

这个世界模型训练完就“退场”,机器人反而更能干了

GPT-6带火循环Transformer,阿里早已布局

押中SpaceX的硅谷老将,把票投给了一家中国世界模型公司

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1