论文解读

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

语音交互 | 6.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4044 字 阅读 →
论文解读

Why GPT-Style Models Do Not Directly Transfer to Symbolic Music: Compression in the Wrong Coordinate System

音乐生成 | 6.7/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3187 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-19

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 40 分钟 · 19678 字 阅读 →
论文解读

Cached LLM Probability Retrieval for Speech Recognition

语音识别 | 6.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7301 字 阅读 →
论文解读

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

音视频理解 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6485 字 阅读 →
论文解读

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

音视频语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7037 字 阅读 →
论文解读

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

语音质量评估 | 7.9/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6446 字 阅读 →
论文解读

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

音视频问答 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6710 字 阅读 →
论文解读

FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Conversion for Voice Agent Pipelines

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5096 字 阅读 →
论文解读

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

多模态模型 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6568 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-14

共分析 12 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 36 分钟 · 17828 字 阅读 →
论文解读

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7722 字 阅读 →
论文解读

DuplexWorld: Can voice agents help you get through the day?

语音交互 | 8.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8820 字 阅读 →
论文解读

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

语音翻译 | 6.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5820 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 76 分钟 · 37591 字 阅读 →
论文解读

Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books

音频生成 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6691 字 阅读 →
论文解读

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

音视频语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7993 字 阅读 →
论文解读

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

语音交互 | 8.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6734 字 阅读 →
论文解读

REFRAMED: Towards Realistic Audio Description Generation for Movies

音频字幕生成 | 8.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 9013 字 阅读 →
论文解读

Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation

语音情感识别 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6811 字 阅读 →