又一国产模型重磅开源!有声视往往编辑全球首先,16家芯片及平台首先日适用配|工作流|系列模型_网易订阅

时间:2026-08-08 22:08:00来源:知来藏往网 作者:知识
又一国产模型重磅开源!有声视往往编辑全球首先,16家芯片及平台首先日适用配|工作流|系列模型_网易订阅
智东西作者 杨京丽编辑 李水青智东西8月3日报方式,又国源有用配易订阅今日,产模MiniMax正式开源新一代通用视往往模型MiniMax H3。型重型网MiniMax H3是磅开编辑一个通用型全模态生成系统,可统一理解文本、声视首先首先图像、往往视往往和文章往往组成的全球多模态上下文,生成最首先15秒、家芯最高2K分辨率并带有原生立体声文章往往的片及平台视往往。之前7月31日,日适MiniMax H3发布。工作目前,流系列模在Artificial Analysis有声视往往编辑榜单中,又国源有用配易订阅MiniMax H3以1130分的产模Elo成绩位列首先,领先Gemini Omni Flash、型重型网HappyHorse-1.0、Wan 2.7等国内外视往往模型。▲MiniMax H3位列有声视往往编辑榜单榜首先H3系统由H3-Context-IR、H3-Base、H3-Regenerate-2K三个模块组成。开发者可以直接从Hugging Face下载MiniMax H3模型,H3-Base目前协助通过SGLang、vLLM、diffusers和ComfyUI等推理框架和工作流开展部署。与模型开源同步,华为昇腾、摩尔线程、沐曦、海光材料、昆仑芯、天数智芯、壁仞科技、AMD、Intel等国内外芯片厂商,以及Hugging Face、魔搭ModelScope、ComfyUI、RunningHub、fal等开发社区和云推理平台,另有vLLM-Omni、SGLang等推理框架,共16家生态伙伴均实现了相关适用配协助。开源地址:huggingface.co/MiniMaxAI/MiniMax-H3模型体验地址:H3-2K直出:platform.minimaxi.com/docs/api-reference/video-generation-v2-createH3-Context-IR:platform.minimaxi.com/docs/api-reference/video-generation-v2-h3-context-irH3-Regenerate-2K:platform.minimaxi.com/docs/api-reference/video-generation-v2-regenerationMiniMax Hub: hub.minimaxi.com海螺AI:hailuoai.com今天,智东西对MiniMax H3开展了实测。MiniMax H3已经能够实现不一样类型的视往往生成任务,在画面自然度、镜头组织和整体风格相同性部分谝较好。模型在画面真实感、镜头编排等部分有一定的提高空间。例如,我们让模型生成了一段15秒的风光摄影航拍视往往,成片中的雪山、草地等自然景观较为真实,色彩、光影和航拍镜头运动也比较自然,首先镜头整体保持了较好的视觉连贯性。然而,画面中的寺庙建筑仍有较明显的AI生成感。随后,我们又让MiniMax H3生成了一段奶茶和游戏IP联动的广告宣传视往往。MiniMax生成的视往往涵盖6个分镜头,整体叙事顺序较为清楚,画面风格和广告氛围也基础统一。然而,在多镜头编排部分,模型出现了一处较明显的重复:店员向顾客递出奶茶的动作被后续呈现了两次。一、最首先生成15秒2K视往往,画面与立体声同步输出MiniMax H3 是一个通用型全模态生成系统。在输出规格部分,H3可生成4秒至15秒的视往往,协助21:9、16:9、4:3、1:1、3:4、9:16等多种画面比例,输出帧率为24FPS,并可同步生成32kHz立体声文章往往。模型默认生成短边为768像素的视往往,通过H3-Regenerate-2K可进一步生成2K版本。H3稳固协助中文、英语、日语、韩语、法语、德语等11种语言,对其他语言也给予不一样程度的协助。H3涵盖FL2VA和Ref2VA两个版本,分别照章性首先尾帧生成与全模态参考生成。H3-Base-FL2VA为首先尾帧模式,最多可输入两张图像。不输入图像时,模型实施文生视往往任务;输入一张首先帧或尾帧图像时,可生成对应的首先帧生视往往或尾帧生视往往;同时输入两张图像时,则可根据指定的首先尾画面生成中间的视往往材料。H3-Base-Ref2VA协助全模态参考模式,最多可输入9张图像;视往往最多可输入3段,每段时首先为2秒至15秒,总时首先不超过15秒;文章往往最多可输入3段,每段时首先为2秒至15秒,总时首先不超过15秒,且必须与图像或视往往一同输入,不能作为唯一输入。图像、视往往和文章往往文件合方式最多可输入12个。二、三大模块协同生成文章视往往,2K画面采取上下文再生成H3系统由负责理解和整理多模态指令的H3-Context-IR、负责生成文章视往往的H3-Base,以及负责生成2K画面的H3-Regenerate-2K三个模块组成。▲MiniMax H3系统概览(图源:MiniMax)H3-Context-IR是一套托管式预处理与编排系统,能够理解文本、图像、文章往往和参考视往往之间的关系,以及这些素材与预期生成结荚之间的关系。其内部工作流涵盖指令解析、跨模态关联、时序理解和复杂逻辑推理。H3-Context-IR依赖多时期工作流,以及多个托管模型与服务,该模块暂未开源。MiniMax目前给予了相应API和提示词指南,开发者可以据此搭建自己的多模态预处理系统。视往往提示词写作指南:huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md全参考模式输出指南:huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.mdH3-Base负责实际的文章视往往生成。文本由H3-Encoder编码,视觉素材同时经过H3-Encoder和H3-VisualVAE处理,文章往往则由H3-AudioVAE编码。不一样模态的材料随后被组织成统一序列,输入H3-Omni-Transformer。▲MiniMax H3-Base架构概览(图源:MiniMax)对于H3的2K分辨率输出,H3没有采取传统的专用超分辨率模块,而是通过H3-Regenerate-2K,让基础模型结合原始文本及多模态参考素材,对已经生成的768p视往往重新生成。这种方式可以再次利用原始上下文,有助于还原小文字和精细纹理等仅凭低分辨率画面难以补全的材料。该模块目前同样尚未开源,开发者可通过官方API复现完善的2K生成步骤。三、本地部署可生成768p文章视往往,完善2K工作流需调用APIMiniMax为开发者给予了H3-Base本地部署和完善2K工作流两种验明正身方式。H3-Base以FL2VA和Ref2VA两个独立模型仓库发布,均涵盖处理器、分词器、文本编码器、Omni Transformer、Visual VAE和Audio VAE等推理组件,可通过SGLang、vLLM、diffusers和ComfyUI等框架或工作流部署,并协助多GPU并行推理。仅在本地部署H3-Base时,开发者可以生成短边为768像素的文章视往往。其中,FL2VA版本协助文生文章视往往及首先尾帧生成,Ref2VA版本协助联合参考图像、视往往和文章往往,实现角色与场景保留、动作和嘴型编辑、文章色参考等任务。完善2K工作流则需结合本地模型与官方API:先由H3-Context-IR理解并扩展用户输入,随后由本地部署的H3-Base生成768p文章视往往,最后通过H3-Regenerate-2K结合原始上下文重新生成2K视往往。MiniMax还给予了文生文章视往往、首先帧生文章视往往和全模态参考生成等可复现案例,相关请求参数、示例代码和参考结荚均可在Hugging Face模型页面查看。结语:全模态视往往生成加高效走向开放生态从实际成效来看,MiniMax H3已经能够处理自然风光、商业广告等不一样类型的生成任务,在画面自然度、镜头组织和风格相同性部分展现出较高的实现度。随着多家芯片厂商、开发社区、云推理平台和推理框架同步实现适用配,MiniMax H3此次开源不仅开放了模型能力,也初步打通了从模型下载、本地部署到采取开发的生态链路。全模态视往往模型之间的竞争,正从单一画面成效进一步延伸至声文章生成、复杂指令理解和产业生态建设。
相关内容
推荐内容
热点内容