论文解读

A Personalized Real-Time Proactive Voice Memory Assistant

实时处理 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4384 字 阅读 →
论文解读

Advancing Speech Understanding in Speech-Aware Language Models with GRPO

语音问答 | 7.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3396 字 阅读 →
论文解读

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4356 字 阅读 →
论文解读

An Anomaly-Aware and Audio-Enhanced Dual-Pathway Framework for Alzheimer’s Disease Progression Classification

语音生物标志物 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5640 字 阅读 →
论文解读

AUDIOGENIE-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5308 字 阅读 →
论文解读

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3824 字 阅读 →
论文解读

Clue2Emo: A Brain-Inspired Framework for Open-Vocabulary Multimodal Emotion Recognition

语音情感识别 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 6003 字 阅读 →
论文解读

Confidence-Guided Error Correction for Disordered Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4863 字 阅读 →
论文解读

Content Anonymization for Privacy in Long-Form Audio

语音匿名化 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4691 字 阅读 →
论文解读

Context-Aware Dynamic Graph Learning for Multimodal Emotion Recognition with Missing Modalities

语音情感识别 | 8.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4275 字 阅读 →
论文解读

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

生成模型 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5619 字 阅读 →
论文解读

Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems

语音对话系统 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4864 字 阅读 →
论文解读

EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5127 字 阅读 →
论文解读

EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4419 字 阅读 →
论文解读

Equipping Large Language Model with Directional Speech Understanding Capabilities

语音识别 语音翻译 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4467 字 阅读 →
论文解读

Flexi-LoRA with Input-Adaptive Ranks: Efficient Finetuning for Speech and Reasoning Tasks

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3543 字 阅读 →
论文解读

Generative UI as an Accessibility Bridge: Lessons from C2C E-Commerce

无障碍 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4025 字 阅读 →
论文解读

HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-Based TTS

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4633 字 阅读 →
论文解读

Hierarchical Tokenization of Multimodal Music Data for Generative Music Retrieval

音乐检索 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4794 字 阅读 →
论文解读

Improving Contextual Asr Via Multi-Grained Fusion With Large Language Models

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3976 字 阅读 →