论文解读

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

跨模态 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4377 字 阅读 →
论文解读

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

说话人识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4588 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-27

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20102 字 阅读 →
论文解读

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

机器人技能学习 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3742 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-25

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 6 分钟 · 2986 字 阅读 →
论文解读

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6680 字 阅读 →
论文解读

Evaluation of Automatic Speech Recognition Using Generative Large Language Models

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3189 字 阅读 →
论文解读

Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3626 字 阅读 →
论文解读

Low-Rank Adaptation Redux for Large Models

大语言模型 | 5.5/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1870 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-24

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 59 分钟 · 29279 字 阅读 →
论文解读

FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection

这篇论文针对全双工语音对话系统中需要低延迟、高精度判断用户是否结束发言(轮次检测)的难题,提出了FastTurn统一框架。其核心方法是将流式CTC解码提供的快速部分语义信息,与Conformer编码器提取的声学特征,通过适配器输入给大语言模型(LLM)进行推理,并最终融合声学与语义特征进行轮次预测。

 · 更新于 2026-09-25 · 约 10 分钟 · 4565 字 阅读 →
论文解读

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

1. **问题**:工业机器人需要频繁适应新任务和环境,但现有技能调整方法(如手动重编程)对非专家用户不友好,且单一交互模态无法高效处理所有类型的调整需求。 2. **方法核心**:提出MOMO框架,集成三种互补交互模态:动觉接触(用于精确空间修正)、自然语言(用于高层语义修改)和图形界面(用于参数

 · 更新于 2026-09-25 · 约 9 分钟 · 4373 字 阅读 →
论文解读

Detecting Hallucinations in SpeechLLMs at Inference Time Using Attention Maps

本文旨在解决语音大模型(SpeechLLMs)在推理时产生的“幻觉”问题,即生成与输入音频不符的流畅文本。现有方法依赖昂贵的黄金标准输出,而文本LLM的方法无法捕捉音频特有信号。为此,作者提出了四个基于注意力图的轻量级指标(AudioRatio, AudioConsistency, AudioEnt

 · 更新于 2026-09-25 · 约 9 分钟 · 4059 字 阅读 →
论文解读

NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations

这篇论文旨在解决语音合成(TTS)领域中一个关键但被忽视的问题:如何标准化评估系统生成非语言声音(NVV,如笑声、叹息)的能力。作者提出了**NVBench**,一个包含**45类NVV统一分类体系**的双语(英/中)基准。其核心方法包括:1)构建了一个每类50例、总计4500例的高质量平衡评估数据

 · 更新于 2026-09-25 · 约 10 分钟 · 4905 字 阅读 →
论文解读

Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

这篇论文旨在解决生成式目标说话人提取(TSE)模型在流式实时应用中因依赖全局上下文而导致性能严重下降的核心问题。作者首次提出了一个基于自回归语言模型(LauraGPT)的流式TSE框架。其核心创新是“分块交织拼接范式”,通过将混合音频块与对应的目标语音离散编码块交错排列作为模型输入,严格保证了推理的

 · 更新于 2026-09-25 · 约 11 分钟 · 5068 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 44 分钟 · 21691 字 阅读 →
论文解读

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

这篇论文旨在解决大语言模型在歌词到旋律生成任务中,通过监督微调(SFT)训练出的模型常产生音乐上不可行(如节奏怪异、音域超限)的“约束违反”问题。**核心贡献**是提出了一套无需人工标注、基于规则约束的自动化对齐框架。**关键方法**分为三步:首先对预训练LLM进行SFT以获得基础生成能力;其次,利

 · 更新于 2026-09-25 · 约 10 分钟 · 4941 字 阅读 →
论文解读

SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

本文旨在解决对话系统中情感识别(ERC)与情感表达能力受限于高质量标注数据稀缺且静态的问题。**核心贡献**是提出了一个心理学动机的自我进化框架 **SELF-EMO**。**关键方法**是构建一个角色扮演的自博弈范式,使模型同时充当“情绪识别者”和“对话响应者”,并通过一个“生成-筛选-重用”的数

 · 更新于 2026-09-25 · 约 8 分钟 · 3893 字 阅读 →
论文解读

ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing

这篇论文旨在解决现有角色扮演研究局限于文本模态,而忽视了日常交流中主导的语音模态的问题。为此,作者首先**定义了“语音角色扮演”任务**,要求模型能根据角色、场景和对话历史,生成带有个性化语音特征(如特定情感、语调)的自发性回应。为此,他们构建了**ActorMindBench**,这是一个基于《老

 · 更新于 2026-09-25 · 约 11 分钟 · 5323 字 阅读 →
论文解读

Discrete Token Modeling for Multi-Stem Music Source Separation with Language Models

本文提出了一种用于多轨音乐源分离的生成式框架,其核心创新在于将分离任务重新定义为**条件离散令牌生成**问题。传统方法直接在时频域估计连续信号,而本文方法首先利用**HCodec**神经音频编解码器将音频波形转换为离散的声学与语义令牌序列。然后,一个基于**Conformer**的条件编码器从混合音

 · 更新于 2026-09-25 · 约 10 分钟 · 4961 字 阅读 →