编辑:艾伦
【新致远介绍】两个多月前对标GPT-4o的端到端语音模型终于开源了。卡尔帕蒂大师体验后说道:
前阵子凭借技术震撼大家、参考GPT-4o的实时语音模型Moshi终于开源了。
聊天自然、情感丰富,随意打断,拒绝严格的回合制规则。
卡帕蒂大师在体验后也这么说。
法国创业团队Kyutai于7月初发布了这个神奇的端到端语音模型对标GPT-4o。
两个多月后的今天,他们兑现了承诺,开源了他们的代码、模型权重和一份很长的技术报告。
论文地址:https://kyutai.org/Moshi.pdf
开源代码:https://github.com/kyutai-labs/moshi
公开权重:https://huggingface.co/collections/kyutai
在大洋彼岸,GPT-4o的语音模式尚未完全发布,但该模式正在免费分发。
您可以访问官方网站(moshi.chat) 免费在线试用。相比AI语音助手平时提出问题、回答问题的方式,这种“类人”的聊天方式还是很奇怪的。
整个模型的参数量为7.69B。 pytorch平台只有bf16版本,显存提供8位版本。该版本可在mlx 上使用。
mosiko和moshika分别代表男性和女性版本
moshi 作为一个全双工语音交互框架,由几个部分组成。首先是咪咪。它是最先进的流式神经音频编解码器,能够以完全流式传输方式(80 毫秒延迟)处理24 kHz 音频(12.5 Hz),带宽为1.1 kbps。
接下来是Transformer部分,负责存储、理解、输出知识,包括Helium Temporal Transformer和Depth Transformer。
小而深的Transformer 负责对特定时间步的码本之间的依赖关系进行建模,而大型(7B 参数)时间Transformer 则对时间依赖关系进行建模。
作者还提出了一种“内部独白”,即在训练和推理过程中对文本和语音进行联合建模。这使得模型能够充分利用文本模态传达的知识,同时保留语音功能。
Moshi 模拟两个音频流。一份来自Moshi 本身(模型输出),一份来自用户(音频输入)。
沿着这两个音频流,Moshi 可以预测与您的话语(内心独白)相对应的文本,从而显着提高生成的质量。
Moshi 的理论延迟为160ms(80ms Mimi 帧大小+ 80ms 声学延迟),L4 GPU 上的实际总延迟仅为200ms。
技术细节
Moshi突破了传统AI交互模型的局限性,包括延迟、文本信息瓶颈、回合建模等。
Moshi 用更小的音频语言模型增强了文本LLM 骨干,通过理解输入并直接在音频域中生成输出来解决文本的信息瓶颈,同时受益于底层文本LLM 知识的消除。和推理能力。
Moshi 扩展了之前关于音频语言模型的工作,引入了第一个多流音频语言模型,该模型将输入音频流和输出音频流联合且显式地处理为两个自回归令牌流,完全消除了用户控制的概念。这使您可以在自然对话中训练模型。使用任何动态(重叠和中断)。
Helium
首先我想介绍一下Helium,它负责文本部分。这里使用了一些比较常见的设计。
例如,我们对注意力层、前馈层和输出线性层的输入使用RMS 归一化,并使用旋转位置嵌入(RoPE)、4,096 个token 的上下文长度和FlashAttend 来进行高效训练。门功能。
Helium 的分词器基于SentencePiece 的一元模型,包含32,000 个元素,主要针对英语。
作者将所有数字拆分为单个数字,并使用字节退避来防止分词器丢失信息。使用AdamW 优化器训练模型。首先使用固定学习率,然后执行余弦学习率衰减。
7B 用于训练Helium 语言模型和Moshi 架构的超参数
研究人员在公共英语数据的2.1T tokens 上对模型进行了预训练。
训练数据包括维基百科、Stack Exchange 和大量科学文章。我们还依靠网络爬取(特别是来自CommonCrawl的数据)来扩展我们的数据集,通过去重、语言识别、质量等操作获得高质量的训练集。过滤。
Mimi
Mimi 使用残差矢量量化(RVQ) 将音频转换为Moshi 预测的离散标记,并将非因果高级语义信息通过蒸馏传输到因果模型生成的标记,从而实现流式编码和解码。
Mimi 架构受到SoundStream 和Encodec 的启发,其中编码器通过级联残差卷积块将单通道波形投影为潜在表示。由于所有卷积都是因果的,因此该自动编码器可以以流方式执行。
Mimi 的编码器使用四个步长(4, 5, 6, 8) 的卷积块和步长2 的一维卷积,将24kHz 波形投影为12.5 帧/秒和维度512 的潜在表示,而解码器则使用转置卷积来投影24kHz 音频上的潜在表示。
为了提高Mimi 将音频编码为紧凑表示的能力,研究人员在量化前后向模型添加了Transformer 模块。
每个Transformer 块包含8 层、8 个头,使用RoPE 位置编码、有限上下文的250 帧(20 秒)、模型维度512 和MLP 维度2048。使用LayerScale 稳定您的训练。对角线值初始化为0.01。两个Transformer 都使用因果屏蔽来保持整体架构与流式推理的兼容性。
Moshi
Moshi 是一种新的音频语言建模架构,它将Helium 与较小的Transformer 模型相结合,以分层流媒体方式预测音频标记。
这种无条件音频语言模型以流式方式生成音频,同时提供比非流式模型更好的清晰度和音频质量。作者进一步扩展了这种架构,以并行模拟多个音频流,使其在概念上和实践上都很容易处理具有任意动态的全双工对话。
在上面所示的整体架构中,RQ Transformer 将长度为K S 的平坦序列分解为大型时间Transformer 的S 个时间步长,并生成上下文嵌入来调整K 步长Transformer 上的较小深度。
与使用单个模型对扁平序列进行建模相比,这允许您通过增加S 来扩展到更长的序列,或者通过增加K 来扩展到更深的深度。
架构为 的深度Transformer 有6 层、维度1024、16 个注意力头。与之前的工作不同,作者对线性层、投影层和全连接层的深度Transformer 的每个索引使用不同的参数。
事实上,不同的子序列可能需要不同的转换。鉴于该Transformer 的尺寸较小,这对训练和推理时间没有影响,但上面的结果表明这种深度参数化是有益的。
内心独白
内心独白是一种训练和推断口语模型的新方法,通过在语音标记显着改善之前预测时间对齐的文本标记来提高所生成语音的事实性和语言质量。
Moshi 可以从您的声音和Moshi 的声音中推断出非语言信息,这与Moshi 在其语音输出中生成文本一致。根据过去的观察,从粗到细的生成(从语义到声学标记)对于生成一致的语音非常重要。
作者利用这种层次结构,并使用文本标记作为语义标记每个时间步长的前缀。实验表明,这不仅显着提高了生成语音的长度和质量,而且还允许单个延迟超参数将ASR 模型转换为TTS 模型,而无需更改损失、架构或训练数据。您可以看到切换是如何进行的。可能的。
参考:
https://x.com/kyutai_labs/status/1836427396959932492
版权声明:本文转载于网络,版权归作者所有。如有侵权,请联系本站编辑删除。