论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6243 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4797 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4653 字 阅读 →
论文解读

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4253 字 阅读 →
论文解读

Tell me Habibi, is it Real or Fake?

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3720 字 阅读 →
论文解读

TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4181 字 阅读 →
论文解读

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5344 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-02

共分析 4 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 15 分钟 · 7026 字 阅读 →
论文解读

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models

说话人识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4581 字 阅读 →
论文解读

Selective Augmentation: Improving Universal Automatic Phonetic Transcription via G2P Bootstrapping

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3160 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-01

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 70 分钟 · 35064 字 阅读 →
论文解读

EmoTransCap: Dataset and Pipeline for Emotion Transition-Aware Speech Captioning in Discourses

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5250 字 阅读 →
论文解读

One Voice, Many Tongues: Cross-Lingual Voice Cloning for Scientific Speech

语音克隆 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4425 字 阅读 →
论文解读

Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5558 字 阅读 →
论文解读

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4165 字 阅读 →
论文解读

PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech

语音合成 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4333 字 阅读 →
论文解读

StarDrinks: An English and Korean Test Set for SLU Evaluation in a Drink Ordering Scenario

数据集 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3921 字 阅读 →
论文解读

A Generative-First Neural Audio Autoencoder

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5163 字 阅读 →
论文解读

A Text-To-Text Alignment Algorithm for Better Evaluation of Modern Speech Recognition Systems

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3720 字 阅读 →