每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 75 分钟 · 37568 字 阅读 →
论文解读

归纳一次反复复用:从三段音频中提炼可迁移的听答步骤

针对音频问答中少样本演示不稳定且每次推理都要重复传入演示音频的问题,论文提出每个任务只归纳一次纯文字指令的 Audio-Induct,并在 9 个大音频语言模型与两个基准上验证其准确率与推理开销,代价是小模型自行归纳仍不稳定且对策略思维链仅边缘显著。

 · 更新于 2026-09-25 · 约 17 分钟 · 8402 字 阅读 →
论文解读

冷启动可用与少样本高精度的分野:域不变韵律与自监督表示的跨域语音钓鱼检测对比

在从场景化演员录音训练、真实诈骗电话测试的跨域条件下,论文对比域不变的 4 维韵律特征与冻结的 HuBERT/wav2vec2.0 表示,显示 4 维韵律在零样本达 69.5% F1 可直接部署,而 HuBERT 在 5 样本时达 94.2% F1 但需真实样本与 GPU。

 · 更新于 2026-09-25 · 约 20 分钟 · 9577 字 阅读 →
论文解读

别把旧类压成一个点:SPECTRA 用低秩几何给 5-shot 音频增量学习留住记忆

音频分类 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5815 字 阅读 →
论文解读

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

音频理解 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6302 字 阅读 →
论文解读

An Analytical-Prior Framework for Data-Efficient Prediction of Sound-Reduction Frequencies in Rectangular Side-Branch Helmholtz Resonators

预训练 | 5.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7170 字 阅读 →
论文解读

Audio Diarization: A New Paradigm for Exploring Audio Recordings with Unknown Event Classes

说话人日志 | 4.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6151 字 阅读 →
论文解读

Rag Classification of Tagore Songs using Symbolic Music Notation and Novel Weighted Distance Measures

音乐理解 | 3/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4733 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-09

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 47 分钟 · 23491 字 阅读 →
论文解读

RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain

音频理解 | 8.1/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6569 字 阅读 →
论文解读

Language Model Augmented Semi-Supervised Statistical Inference

语音属性识别 | 5.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6984 字 阅读 →
论文解读

Scaling few-shot spoken word classification with generative meta-continual learning

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7189 字 阅读 →
论文解读

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

语音生成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5015 字 阅读 →
论文解读

Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4906 字 阅读 →
论文解读

Few-Shot Accent Synthesis for ASR with LLM-Guided Phoneme Editing

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5168 字 阅读 →
论文解读

Hankel and Toeplitz Rank-1 Decomposition of Arbitrary Matrices with Applications to Signal Direction-of-Arrival Estimation

声源定位 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3385 字 阅读 →
论文解读

A Bayesian Approach to Singing Skill Evaluation Using Semitone Pitch Histogram and MCMC-Based Generated Quantities

音乐理解 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4110 字 阅读 →
论文解读

Denoising Of Stochastic Ray Tracing Room Impulse Responses

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4886 字 阅读 →
论文解读

EdgeSpot: Efficient and High-Performance Few-Shot Model for Keyword Spotting

语音活动检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4076 字 阅读 →
论文解读

EMG-to-Speech with Fewer Channels

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4171 字 阅读 →