论文解读

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

语音对话系统 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4572 字 阅读 →
论文解读

Hashing-Baseline: Rethinking Hashing in the Age of Pretrained Models

音频检索 音频分类 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4362 字 阅读 →
会议任务专题

ICASSP 2026 - 基准测试

共 5 篇 ICASSP 2026 基准测试 方向论文

 · 更新于 2026-09-25 · 约 18 分钟 · 8925 字 阅读 →
论文解读

Leveraging prediction entropy for Automatic prompt weighting in Zero-Shot Audio-Language Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4393 字 阅读 →
论文解读

LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech

基准测试 | 7.8/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3975 字 阅读 →
论文解读

Measuring Prosody Diversity in Zero-Shot TTS: A New Metric, Benchmark, and Exploration

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4416 字 阅读 →
论文解读

Mitigating Shared-Private Branch Imbalance via Dual-Branch Rebalancing for Multimodal Sentiment Analysis

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5421 字 阅读 →
论文解读

MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4488 字 阅读 →
论文解读

Multi-Layer Attentive Probing Improves Transfer of Audio Representations for Bioacoustics

生物声学 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4488 字 阅读 →
论文解读

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

音乐推荐 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4258 字 阅读 →
论文解读

PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5099 字 阅读 →
论文解读

RHO-PERFECT: Correlation Ceiling for Subjective Evaluation Datasets

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4357 字 阅读 →
论文解读

RMODGDF: A Robust STFT-Derived Feature for Musical Instrument Recognition

音乐信息检索 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4290 字 阅读 →
论文解读

Savgbench: Benchmarking Spatially Aligned Audio-Video Generation

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4030 字 阅读 →
论文解读

SED: Structural Entropy Based Speech Discretization for Discrete Token-Based ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4993 字 阅读 →
论文解读

SingMOS-Pro: An Comprehensive Benchmark For Singing Quality Assessment

歌唱语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3984 字 阅读 →
论文解读

SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4202 字 阅读 →
论文解读

Step-Audio-R1.5 Technical Report

语音对话系统 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4640 字 阅读 →
论文解读

Streamingbench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3905 字 阅读 →
论文解读

StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4238 字 阅读 →