小米开源 MiDashengLM?Gen,实现多元素混合音频场景统一生成

小米开源 MiDashengLM?Gen,实现多元素混合音频场景统一生成

800_auto

小米研究院正式开源 MiDashengLM?Gen 音频生成框架,项目代码、权重已发布于 GitHub 与 HuggingFace,采用 Apache?2.0 协议开放,面向开发者提供完整音频场景合成能力。

该框架以 Qwen3?1.7B 大模型为骨干,结合自研 DashengTokenizer 音频编码器,采用大模型驱动的自回归...

点击查看剩余70%

{{collectdata}}

网友评论