论文解读

发音纠错不能只给分数:让音频语言模型说出错在哪、怎么练

论文研究朗读式聊天发音训练,用 L2-Arctic-plus 提供词级错误解释与可操作建议,通过两阶段指令微调音频语言模型,在误读检测与建议生成上超过级联 ASR 加 LLM 和现有开源模型,代价是依赖合成标注与朗读场景。

 · 更新于 2026-09-24 · 约 18 分钟 · 8778 字 阅读 →
论文解读

耦合失真下不换模型而换管线:StrixAE 用智能体调度专家模型

针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。

 · 更新于 2026-09-24 · 约 22 分钟 · 10852 字 阅读 →
论文解读

从一次性生成到先诊断再重做:LoopTTS 如何让语音大模型当韵律医生

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12606 字 阅读 →
论文解读

Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text

语音交互 | 10.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4838 字 阅读 →
论文解读

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

音频生成 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7166 字 阅读 →
论文解读

Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models

音频生成 | 7.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7410 字 阅读 →
论文解读

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

语音翻译 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5932 字 阅读 →
论文解读

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

音视频问答 | 8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5975 字 阅读 →
论文解读

SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering

音频修复 | 8/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8353 字 阅读 →
论文解读

Unlocking Speech–Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

语音交互 | 6.7/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7653 字 阅读 →
论文解读

Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment

音乐情感识别 | 4.9/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10281 字 阅读 →
论文解读

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

数据增强 | 8.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6462 字 阅读 →
论文解读

TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

多模态模型 | 6.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6186 字 阅读 →
论文解读

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

语音情感识别 | 8.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5028 字 阅读 →
论文解读

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

语音质量评估 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5548 字 阅读 →
论文解读

Cross-Lingual Alzheimer’s Disease Detection with Multimodal LLMs via Speech Cue-Augmented Prompting and Instruction Tuning

语音生物标志物 | 6.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4634 字 阅读 →
论文解读

MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding

音乐理解 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4303 字 阅读 →
论文解读

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

语音合成评估 | 7.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6277 字 阅读 →
论文解读

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

语音质量评估 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5555 字 阅读 →