论文解读

InstructFX2FX: A Multi-turn Text-to-Preset Demo for Iterative Audio Effect Refinement

对比学习 | 8.6/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5470 字 阅读 →
论文解读

Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems

Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems

 · 更新于 2026-09-07 · 约 6 分钟 · 2603 字 阅读 →
论文解读

Interleaved Speech Language Models Latently Work In Text

语音识别 | 6.4/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5690 字 阅读 →
论文解读

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

语音合成 | 6.6/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4805 字 阅读 →
论文解读

Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification

说话人验证 | 7.6/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4879 字 阅读 →
论文解读

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

音频水印 | 8/10

 · 更新于 2026-09-07 · 约 15 分钟 · 7077 字 阅读 →
论文解读

Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering

音频问答 | 6.9/10

 · 更新于 2026-09-07 · 约 10 分钟 · 5003 字 阅读 →
论文解读

Learning to Evade: Adaptive Attacks on Audio Watermarking

音频水印 | 7.6/10

 · 更新于 2026-09-07 · 约 14 分钟 · 6742 字 阅读 →
论文解读

Libretto: Giving LLM Agents a Sense of Musical Structure

音乐生成 | 9.2/10

 · 更新于 2026-09-07 · 约 14 分钟 · 6981 字 阅读 →
论文解读

LISE : Listenable Interpretable Speaker Embeddings

说话人验证 | 6.8/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5422 字 阅读 →
论文解读

LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU

音乐生成 | 7.0/10

 · 更新于 2026-09-07 · 约 15 分钟 · 7390 字 阅读 →
论文解读

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

语音识别 | 5.8/10

 · 更新于 2026-09-07 · 约 7 分钟 · 3142 字 阅读 →
论文解读

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

 · 更新于 2026-09-07 · 约 17 分钟 · 8096 字 阅读 →
论文解读

Noise-Driven Instrument Based on Coherent Quantum and Stochastic Oscillator Models

Noise-Driven Instrument Based on Coherent Quantum and Stochastic Oscillator Models

 · 更新于 2026-09-07 · 约 1 分钟 · 268 字 阅读 →
论文解读

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

语音合成 | 7.4/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5272 字 阅读 →
论文解读

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

语音识别 | 7.2/10

 · 更新于 2026-09-07 · 约 21 分钟 · 10439 字 阅读 →
论文解读

OpenWER: Improving Cross-Lingual ASR Evaluation and Enabling Token-Based Accuracy Metrics

语音识别 | 8/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4961 字 阅读 →
论文解读

PHAST-Net: Attention-Guided, Physics-Informed Network for Unified Estimation of Ideal Time-Frequency Representations

音乐信息检索 | 9/10

 · 更新于 2026-09-07 · 约 15 分钟 · 7438 字 阅读 →
论文解读

Physics-Informed Neural Operator for Speech Production Analysis

语音合成 | 6.7/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4938 字 阅读 →
论文解读

PIVOTSBench: Evaluating Fine-Grained Interpersonal Relationship Reasoning in Multimodal Large Language Models

基准测试 | 6.8/10

 · 更新于 2026-09-07 · 约 24 分钟 · 11528 字 阅读 →