论文解读

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

语音交互 | 8.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7382 字 阅读 →
论文解读

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

语音伪造检测 | 6.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6644 字 阅读 →
论文解读

Language Model Augmented Semi-Supervised Statistical Inference

语音属性识别 | 5.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6984 字 阅读 →
论文解读

Multiple Choice Learning of Low-Rank Adapters for Language Modeling

多模态模型 | 8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6764 字 阅读 →
论文解读

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

空间音频 | 8.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8299 字 阅读 →
论文解读

Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech

语音合成 | 7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6988 字 阅读 →
论文解读

The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning

知识蒸馏 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6068 字 阅读 →
论文解读

Zero-Shot Rankability: Revealing Latent Ordinal Structure in Multimodal Large Language Models via Language

音视频理解 | 6.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6730 字 阅读 →
论文解读

A Text-Steerable Instrument for Sketching Procedural Soundscapes via Language Models

音乐生成 | 6.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5326 字 阅读 →
论文解读

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

音频理解 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8254 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-02

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24050 字 阅读 →
论文解读

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

音乐生成 | 9.4/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1658 字 阅读 →
论文解读

LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features

参数高效微调 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4940 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-30

共分析 35 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 102 分钟 · 51078 字 阅读 →
论文解读

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5871 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-29

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 46 分钟 · 22697 字 阅读 →
论文解读

Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?

语音识别 | 7.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5097 字 阅读 →
论文解读

Graph-Based Phonetic Error Correction of Noisy ASR

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6592 字 阅读 →
论文解读

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

语音翻译 | 7.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6956 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-25

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38268 字 阅读 →