小米发布声音理解大模型MiDashengLM-7B
小米今日发布和全量开源MiDashengLM-7B模型。作为其 “人车家全生态” 关键技术,将广泛赋能智能座舱、智能家居等场景。据介绍,MiDashengLM-7B以Xiaomi Dasheng作为音频编码器和Qwen2.5-Omni-7B Thinker作为自回归解码器,通过创新的通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解,声音理解性能在22个公开评测集上刷新多模态大模型最好成绩(SOTA),单样本推理的首Token延迟(TTFT)仅为业界先进模型的 1/4 ,同等显存下的数据吞吐效率是业界先进模型的20倍以上。
—— 小米技术
小米今日发布和全量开源MiDashengLM-7B模型。作为其 “人车家全生态” 关键技术,将广泛赋能智能座舱、智能家居等场景。据介绍,MiDashengLM-7B以Xiaomi Dasheng作为音频编码器和Qwen2.5-Omni-7B Thinker作为自回归解码器,通过创新的通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解,声音理解性能在22个公开评测集上刷新多模态大模型最好成绩(SOTA),单样本推理的首Token延迟(TTFT)仅为业界先进模型的 1/4 ,同等显存下的数据吞吐效率是业界先进模型的20倍以上。
—— 小米技术