DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling ...
DualSpeechLM论文总结与关键部分翻译一、文章主要内容本文聚焦于解决现有语音大语言模型(Speech LLMs)在统一语音理解与生成任务中面临的两大核心挑战:一是语音令牌与文本令牌间存在巨大模态鸿沟,需大规模配对数据进行微调;二是理解任务依赖高层语义信息,生成任务依赖细粒度声学特征,二者信息需求差异导致统一模型性能难以优化。为应对上述挑战,研究提出两大核心方案:理解驱动语音令牌生成器(USTokenizer):基于预训练Whisper编码器、向量量化器(VQ)及冻结文本LLM,通过重构损失、承诺损失和理解驱动损失,提取与文本LLM语义空间高度对齐的高层语义令牌,大幅降低语音与文本的模态对齐难度。双令牌建模框架(DualSpeechLM):以USToken为输入(支撑理解任务)、声学令牌为输出(支撑生成任务),集成AcousticGPT模块实现端到端训练。同时引入语义监督损失稳定训练,提出“条件链(CoC)”策略增强生成性能,使模型能同时满足理解与生成的差异化信息需求。实验方面,基于4500小时小规模数据,采用LoRA参数高效微调,在语音识别(ASR)、语音翻译(S2TT/T2ST)、语音情感识别(SER)、语音问答(SQA)、文本转语音(TTS)、语音转换(VC)等任务中,DualSpeechLM(尤其是使用USToken的版本)均优于基线模型,且实现理解与生成任务的相互促进,收敛速度更快。二、文章创新点