论文解读

Cross-Lingual Interleaving for Speech Language Models

语音大模型 | 7.5/10

 · 更新于 2026-09-14 · 约 11 分钟 · 5122 字 阅读 →
论文解读

Cross-Linguistic Rhythmic and Spectral Feature-Based Analysis of Nyishi and Adi: Two Under-Resourced Languages of Arunachal Pradesh

Cross-Linguistic Rhythmic and Spectral Feature-Based Analysis of Nyishi and Adi: Two Under-Resourced Languages of Arunachal Pradesh

 · 更新于 2026-09-14 · 约 1 分钟 · 34 字 阅读 →
论文解读

Cross-Modal Bottleneck Fusion for Noise Robust Audio-Visual Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4237 字 阅读 →
论文解读

Cross-Modal Knowledge Distillation for Speech Large Language Models

语音大模型 | 7.0/10

 · 更新于 2026-09-14 · 约 8 分钟 · 3931 字 阅读 →
论文解读

CTC-DID: CTC-Based Arabic Dialect Identification for Streaming Applications

语音识别 | 6.5/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4764 字 阅读 →
论文解读

Curriculum Learning with Contrastive Loss for Lightweight Speaker Verification

说话人验证 | 6.5/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4588 字 阅读 →
论文解读

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

生成模型 | 8.5/10

 · 更新于 2026-09-14 · 约 12 分钟 · 5619 字 阅读 →
论文解读

D3PIA: A Discrete Denoising Diffusion Model for Piano Accompaniment Generation from Lead Sheet

音乐生成 | 7.5/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4875 字 阅读 →
论文解读

DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis

语音合成 | 8.0/10

 · 更新于 2026-09-14 · 约 11 分钟 · 5316 字 阅读 →
论文解读

DAMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMS

视频问答 | 7.0/10

 · 更新于 2026-09-14 · 约 12 分钟 · 5719 字 阅读 →
论文解读

DAT-CFTNet: Speech Enhancement for Cochlear Implant Recipients using Attention-based Dual-Path Recurrent Neural Network

语音增强 | 7.0/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4653 字 阅读 →
论文解读

DBFT-SD: Weakly Supervised Multimodal Detection of Sensitive Audio-Visual Content

音频事件检测 | 8.0/10

 · 更新于 2026-09-14 · 约 8 分钟 · 4008 字 阅读 →
论文解读

DDSC: Dynamic Dual-Signal Curriculum for Data-Efficient Acoustic Scene Classification Under Domain Shift

音频场景分类 | 7.0/10

 · 更新于 2026-09-14 · 约 8 分钟 · 3676 字 阅读 →
论文解读

DDSR-Net: Robust Multimodal Sentiment Analysis via Dynamic Modality Reliability Assessment

语音情感识别 | 6.5/10

 · 更新于 2026-09-14 · 约 17 分钟 · 8029 字 阅读 →
论文解读

DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEG

语音增强 | 7.0/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4453 字 阅读 →
论文解读

Decoder-Only Conformer with Modality-Aware Sparse Mixtures of Experts for ASR

语音识别 | 7.5/10

 · 更新于 2026-09-14 · 约 11 分钟 · 5265 字 阅读 →
论文解读

Decorrelation-Enhanced Multiband Subband Adaptive Filtering for RIR Tracking in Sound Field Control

空间音频 | 7.0/10

 · 更新于 2026-09-14 · 约 8 分钟 · 3685 字 阅读 →
论文解读

Deep Dubbing: End-to-End Auto-Audiobook System with Text-to-Timbre and Context-Aware Instruct-TTS

语音合成 | 7.5/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4986 字 阅读 →
论文解读

Deep Learning-Based Joint Optimization of Adaptive Feedback Cancellation and Residual Feedback Suppression for Hearing Aids

语音增强 | 8.0/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4888 字 阅读 →
论文解读

Deep Spatial Clue Informed Ambisonic Encoding for Irregular Microphone Arrays

空间音频 | 7.0/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4357 字 阅读 →