7月31日,国内人工智能初创企业上海稀宇(MiniMax)正式推出新一代全模态生成模型MiniMax H3,拓展其在多模态人工智能领域的业务版图。据上海稀宇介绍,该模型属于通用型全模态生成架构,能够对文本、图像、视频和音频等多种模态的信息进行统一解析。在生成能力方面,它支持原生输出带有双声道音频的视频内容,最高分辨率可达2K,单次生成时长上限为15秒。
在技术实现上,MiniMax H3依托统一的多模态架构,在单一模型内部即可实现图文音视频的理解与生成闭环。该模型可广泛应用于视频创作、数字内容生产、人机交互以及人工智能助手等多种场景。这种设计打破了以往需要多个独立模型分别处理不同模态任务的局限,增强了跨模态理解的深度以及生成内容的连贯性。此外,通过同步生成画面与双声道音频,提高了视听内容的整体表现力。关于后续规划,上海稀宇透露,将在遵守相关法律法规的基础上,于近几日开放H3模型的权重,以便开发者和科研机构进行本地部署及应用开发,从而持续繁荣开源生态。
近期,国内人工智能大模型的发展重心正从单纯的大型语言模型比拼,逐步向多模态生成及智能体(Agent)能力拓展。除了上海稀宇,众多国内大模型企业也在加速产品迭代与开源进程。
例如,月之暗面推出了主打大型混合专家架构与智能体能力的Kimi K3,并计划开放权重;阿里巴巴不断优化通义千问系列,深化多模态与企业级应用;智谱AI在迭代GLM系列的同时,积极推进与国产人工智能芯片的适配;腾讯则着力推动混元大模型在内容生成、企业服务和智能体等方向的商业落地。随着越来越多企业选择开放模型权重并构建开发者社区,行业竞争已从单一模型的性能较量,全面升级为涵盖完整平台、生态系统及商业化落地能力的综合博弈。