论文解读

Tokenchain: A Discrete Speech Chain via Semantic Token Modeling

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Via Score to Performance: Efficient Human-Controllable Long Song Generation with Bar-Level Symbolic Notation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4896 字 阅读 →
论文解读

VoXtream: Full-Stream Text-To-Speech With Extremely Low Latency

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6227 字 阅读 →
论文解读

When Noise Lowers the Loss: Rethinking Likelihood-Based Evaluation in Music Large Language Models

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4847 字 阅读 →
论文解读

An event-based sequence modeling approach to recognizing non-triad chords with oversegmentation minimization

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4400 字 阅读 →
论文解读

Opening the Design Space: Two Years of Performance with Intelligent Musical Instruments

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4910 字 阅读 →
论文解读

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6055 字 阅读 →
论文解读

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5170 字 阅读 →
论文解读

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

1. **问题**:现有基于离散token的TTS模型,其“粗到细”的生成范式主要体现在从语义token到声学token的转换,而对语音固有的时间动态(temporal dynamics)缺乏显式建模。 2. **方法核心**:提出Chain-of-Details (CoD)框架,将语音生成分解为多

 · 更新于 2026-09-25 · 约 9 分钟 · 4367 字 阅读 →
论文解读

Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

1. **要解决什么问题**:现有基于生成模型(如扩散模型、自回归模型)的目标说话人提取(TSE)方法依赖全局上下文,难以直接用于实时流式场景,强行适配会导致性能严重下降。 2. **方法核心是什么**:提出首个面向流式TSE的自回归(AR)框架,核心是“分块交错拼接范式”。该范式将混合语音分块

 · 更新于 2026-09-25 · 约 11 分钟 · 5046 字 阅读 →
论文解读

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

本文针对符号音乐生成中主流的事件序列(event-based)tokenization方法隐含处理时间规律、导致模型需额外学习时间网格的问题,提出了一种名为**BEAT**的新型网格化tokenization框架。其核心思想是将音乐在时间上均匀离散化为“拍”(beat)作为基本单位,将每拍内每个音高

 · 更新于 2026-09-25 · 约 10 分钟 · 4791 字 阅读 →
论文解读

Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

这篇论文旨在解决生成式目标说话人提取(TSE)模型在流式实时应用中因依赖全局上下文而导致性能严重下降的核心问题。作者首次提出了一个基于自回归语言模型(LauraGPT)的流式TSE框架。其核心创新是“分块交织拼接范式”,通过将混合音频块与对应的目标语音离散编码块交错排列作为模型输入,严格保证了推理的

 · 更新于 2026-09-25 · 约 11 分钟 · 5068 字 阅读 →
论文解读

MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora

这篇论文旨在解决零样本语音模仿任务中高质量平行训练数据稀缺的核心瓶颈。传统方法要么依赖复杂的解耦架构,要么使用合成语音作为训练目标,导致输出质量受限于合成系统的能力。作者提出了一种名为 **MimicLM** 的新框架,其核心创新在于**“角色交换”的数据构建策略**:使用TTS生成的语音作为**训

 · 更新于 2026-09-25 · 约 10 分钟 · 4878 字 阅读 →
论文解读

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

本文针对现有视频到音乐(V2M)生成模型缺乏对创作者风格、主题等细粒度意图控制的问题,提出了Video-Robin,一个结合文本提示的视频配乐框架。其核心方法是将生成过程解耦为两个阶段:首先,一个多模态自回归规划头(AR-Head)整合视频帧和文本提示,通过语义语言模型、有限标量量化(FSQ)和残差

 · 更新于 2026-09-25 · 约 11 分钟 · 5422 字 阅读 →
论文解读

Discrete Token Modeling for Multi-Stem Music Source Separation with Language Models

本文提出了一种用于多轨音乐源分离的生成式框架,其核心创新在于将分离任务重新定义为**条件离散令牌生成**问题。传统方法直接在时频域估计连续信号,而本文方法首先利用**HCodec**神经音频编解码器将音频波形转换为离散的声学与语义令牌序列。然后,一个基于**Conformer**的条件编码器从混合音

 · 更新于 2026-09-25 · 约 10 分钟 · 4961 字 阅读 →
论文解读

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

这篇论文旨在解决大型音频语言模型(LALM)在细粒度时间感知(如精确定位声音事件的起止时间)上的不足。作者提出了**TimePro-RL**框架,其核心是两步走策略:首先,提出**音频侧时间提示(AS

 · 更新于 2026-09-25 · 约 10 分钟 · 4592 字 阅读 →