稀宇科技近日正式发布其最新研发成果——MiniMax H3全模态生成模型。这款模型突破了传统多模态处理的局限,能够同时解析文本、图像、视频及音频构成的复杂上下文,并生成具备原生双声道的音视频内容,最高支持15秒2K分辨率输出,为内容创作领域带来全新可能。
据内部测试数据显示,MiniMax H3在商用场景中展现出显著优势。其指令遵循准确率较前代提升40%,能够精准还原品牌视觉元素与文字信息;在视频到视频动作迁移(V2V Motion Transfer)任务中,模型可实现毫秒级动作捕捉与风格迁移,为电商广告、游戏动画等场景提供高效解决方案。目前,该模型已通过多家头部企业验证,覆盖广告创意、产品设计、UI/UX优化等十余个行业。
技术架构层面,研发团队创新性地引入Caption增强模块,构建了全模态理解管线。通过定制化模型设计,系统可将100K Token的输入素材压缩至平均4K Token输出,在保持语义完整性的同时大幅提升处理效率。特别在视频生成环节,模型摒弃传统超分辨率技术,采用基础模型对低分辨率结果进行上下文感知的迭代优化,成功保留高频细节信息,解决了常规方案中常见的模糊与失真问题。
值得关注的是,稀宇科技宣布将于近期开放MiniMax H3的模型权重下载。此举将降低多模态内容生成的技术门槛,推动AI创作工具在中小企业的普及应用。目前,开发者社区已启动相关文档编写工作,预计将提供包括Python SDK、RESTful API在内的完整开发套件。















