littlePP 发表于 10 小时前

折腾了一晚 MiniMax H3,感觉真正有意思的并不是 2K

这两天体验和整理 MiniMax H3 ,最开始注意到的也是 2K 、最长 15 秒和原生音频,但看完它的输入方式之后,感觉真正值得关注的是“多模态参考”。

以前做 AI 视频,图片负责角色,提示词负责动作,声音和剪辑还要去其他工具处理。H3 现在可以同时放入图片、参考视频和音频,让模型理解人物长相、镜头运动、声音和节奏,生成之后还可以继续通过文字修改部分内容。

最终效果能不能稳定达到宣传水平还需要大量测试,但这个交互方向应该是对的:以后用户可能不再学习复杂提示词,而是直接把参考素材扔进去,再告诉模型哪里需要修改。

查资料的时候看到 https://minimax3.com 和 https://hailuoh3.com ,前者整理了部分模型介绍、案例和提示词,后者偏实际生成流程,有需要测试 H3 的可以一起参考。

一些已经用过 H3 的朋友,说它的人物一致性、中文对白和复杂动作表现还是有点意思的
页: [1]
查看完整版本: 折腾了一晚 MiniMax H3,感觉真正有意思的并不是 2K