论文解读

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

音频深度伪造检测 | 8.1/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4573 字 阅读 →
论文解读

Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4576 字 阅读 →
论文解读

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3824 字 阅读 →
论文解读

Combining SSL Speech Features, Contextual Transformers and Mamba Models for Realistic Audio Spoofing Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4304 字 阅读 →
论文解读

Content-Preserving Speech Representation Learning Via Adaptive Segment-Level Alignment

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5415 字 阅读 →
论文解读

CoVA: Text-Guided Composed Video Retrieval for Audio-Visual Content

跨模态检索 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4170 字 阅读 →
论文解读

Cross-Cultural Bias in Mel-Scale Representations: Evidence and Alternatives from Speech and Music

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4247 字 阅读 →
论文解读

Cross-Lingual Interleaving for Speech Language Models

语音大模型 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5122 字 阅读 →
论文解读

Do Bias Benchmarks Generalise? Evidence from Voice-Based Evaluation of Gender Bias in Speechllms

模型评估 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4695 字 阅读 →
论文解读

EchoFake: A Replay-Aware Dataset For Practical Speech Deepfake Detection

音频深度伪造检测 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3666 字 阅读 →
论文解读

Enhancing Audio Question-Answering Performance Through Log-Likelihood Guided Reward Functions

音频问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4398 字 阅读 →
论文解读

Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3876 字 阅读 →
论文解读

Evaluating Compositional Structure in Audio Representations

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4315 字 阅读 →
论文解读

Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3322 字 阅读 →
论文解读

Evaluating Pretrained Speech Embedding Systems for Dysarthria Detection Across Heterogenous Datasets

语音生物标志物 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3927 字 阅读 →
论文解读

Face-Voice Association with Inductive Bias for Maximum Class Separation

说话人验证 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4756 字 阅读 →
论文解读

Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform

语音伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4224 字 阅读 →
论文解读

FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4353 字 阅读 →
论文解读

FoleyBench: A Benchmark for Video-to-Audio Models

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4402 字 阅读 →
论文解读

From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition

水下声学目标识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4052 字 阅读 →