Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech

📄 十五秒换一个声音:当教师的错误变成学生的课本 英文题目:Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech 一句话:为解决无单人语料时难以部署泰语固定音色合成的问题,论文用零样本克隆教师做可编程数据源经严格过滤与拒绝采样蒸馏出 82M 学生,以挑战集 68.2% 关键词准确率和 91.4% 停顿精确率为证,代价是难词上限仍被教师覆盖锁死。 标签:#语音合成 | #知识蒸馏 | #低资源 | #多语言 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kunat Pipatanakul:机构信息未在 arXiv HTML 中可靠披露 Potsawee Manakul:机构信息未在 arXiv HTML 中可靠披露 Warit Sirichotedumrong:机构信息未在 arXiv HTML 中可靠披露 Sittipong Sripaisarnmongkol:机构信息未在 arXiv HTML 中可靠披露 Pakorn Nathong:机构信息未在 arXiv HTML 中可靠披露 Phatrasek Jirabovonvisut:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把泰语停顿可接受集合形式化并配套可复现的评测管线,让合成流水线的取舍变得可度量。短板在于学生上限被教师分布锁死,挑战集关键词准确率始终落后教师与专有系统,蒸馏更多是在做有损压缩而非能力扩展。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1004 words

Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

📄 不抄答案抄思路:把蒸馏钉在量化器之前 英文题目:Compressing Streaming Neural Audio Encoders via Latent-Space Distillation 一句话:面向端侧听写的常驻音频编码器,论文用冻结教师的量化前潜变量做无标签回归蒸馏,在 2.8 倍压缩下六组师生有五组保持在 1.9% 相对词错误率内,同容量独立训练则落后 3.9%,代价是阶段一波动大且缺少替代目标的直接消融。 标签:#语音识别 | #知识蒸馏 | #模型压缩 | #多语言 评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Prasanth Yadla:Apple Mohammad Samragh:Apple Dongseong Hwang:Apple Mingbin Xu:Apple Yuanyuan Zhang:Apple Chung-Cheng Chiu:Apple Yongqiang Wang:Apple Yuan Liu:Apple Zhen Huang:Apple Xiaodan Zhuang:Apple 💬 毒舌点评 把蒸馏目标钉在量化器前潜变量上的选择干净利落,一份配方同时覆盖离散与连续两种入模接口值得肯定。但全文对为何不直接蒸馏离散标识或解码器输出只有动机论述而无实证对照,阶段一中有一组学生反超教师的异常现象也未被真正解释清楚。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 786 words

Last Translation Benchmark

📄 不再打总分:给每道翻译难题配一把专用量尺 英文题目:Last Translation Benchmark 一句话:面对饱和的机器翻译基准与失灵的整体打分,这项工作用众包难例加逐题验证规则把评价变成可复现的通过率,最强模型仅约四成通过而人工接近满分,代价是样本偏向刻意难题与英文中心。 标签:#语音翻译 | #大语言模型 | #多语言 | #基准测试 | #多模态模型 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Vilém Zouhar:机构信息未在 arXiv HTML 中可靠披露 Niyati Bafna:机构信息未在 arXiv HTML 中可靠披露 Mukund Choudhary:机构信息未在 arXiv HTML 中可靠披露 Maike Züfle:机构信息未在 arXiv HTML 中可靠披露 Sara Rajaee:机构信息未在 arXiv HTML 中可靠披露 Pinzhen Chen:机构信息未在 arXiv HTML 中可靠披露 Jannis Vamvas:机构信息未在 arXiv HTML 中可靠披露 Sara Papi:机构信息未在 arXiv HTML 中可靠披露 Ona de Gibert:机构信息未在 arXiv HTML 中可靠披露 Bhavitvya Malik:机构信息未在 arXiv HTML 中可靠披露 Eliya Habba:机构信息未在 arXiv HTML 中可靠披露 Orfeas Menis Mastromichalakis:机构信息未在 arXiv HTML 中可靠披露 Patrícia Schmidtová:机构信息未在 arXiv HTML 中可靠披露 Michelle Wastl:机构信息未在 arXiv HTML 中可靠披露 Sheriff Issaka:机构信息未在 arXiv HTML 中可靠披露 Leshem Choshen:机构信息未在 arXiv HTML 中可靠披露 Stella Biderman:机构信息未在 arXiv HTML 中可靠披露 Antonis Anastasopoulos:机构信息未在 arXiv HTML 中可靠披露 Jan Niehues:机构信息未在 arXiv HTML 中可靠披露 Rico Sennrich:机构信息未在 arXiv HTML 中可靠披露 Mrinmaya Sachan:机构信息未在 arXiv HTML 中可靠披露 Ondřej Bojar:机构信息未在 arXiv HTML 中可靠披露 Kenton Murray:机构信息未在 arXiv HTML 中可靠披露 Jörg Tiedemann:机构信息未在 arXiv HTML 中可靠披露 Alham Fikri Aji:机构信息未在 arXiv HTML 中可靠披露 Philipp Koehn:机构信息未在 arXiv HTML 中可靠披露 Christof Monz:机构信息未在 arXiv HTML 中可靠披露 Alexandra Birch:机构信息未在 arXiv HTML 中可靠披露 Sowmya Vajjala:机构信息未在 arXiv HTML 中可靠披露 Chalamalasetti Kranti:机构信息未在 arXiv HTML 中可靠披露 Cristina España-Bonet:机构信息未在 arXiv HTML 中可靠披露 Nobin Sarwar:机构信息未在 arXiv HTML 中可靠披露 David Kaczér:机构信息未在 arXiv HTML 中可靠披露 Shunta Asano:机构信息未在 arXiv HTML 中可靠披露 Malik Marmonier:机构信息未在 arXiv HTML 中可靠披露 Daban Q. Jaff:机构信息未在 arXiv HTML 中可靠披露 Vaisakhi Mishra:机构信息未在 arXiv HTML 中可靠披露 Hend Al- Khalifa:机构信息未在 arXiv HTML 中可靠披露 Gabriele Sarti:机构信息未在 arXiv HTML 中可靠披露 Sourajit Saha:机构信息未在 arXiv HTML 中可靠披露 Nils Rehlinger:机构信息未在 arXiv HTML 中可靠披露 Juan Daniel Cuervo Villa:机构信息未在 arXiv HTML 中可靠披露 Jonathan Tonglet:机构信息未在 arXiv HTML 中可靠披露 Saugata Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Dominik Macháček:机构信息未在 arXiv HTML 中可靠披露 Jagannathan Ramanujam:机构信息未在 arXiv HTML 中可靠披露 Heejin Do:机构信息未在 arXiv HTML 中可靠披露 Zuzana Nadova:机构信息未在 arXiv HTML 中可靠披露 Fred Philippy:机构信息未在 arXiv HTML 中可靠披露 Fabian Retkowski:机构信息未在 arXiv HTML 中可靠披露 Maria Lymperaiou:机构信息未在 arXiv HTML 中可靠披露 Silvia Casola:机构信息未在 arXiv HTML 中可靠披露 Hanna Yukhymenko:机构信息未在 arXiv HTML 中可靠披露 Shubhashis Roy Dipta:机构信息未在 arXiv HTML 中可靠披露 Sangwon Ryu:机构信息未在 arXiv HTML 中可靠披露 Andrés Jerez:机构信息未在 arXiv HTML 中可靠披露 Ron Keinan:机构信息未在 arXiv HTML 中可靠披露 Shuaib Shuaib Yusuf:机构信息未在 arXiv HTML 中可靠披露 Avantica Vempati:机构信息未在 arXiv HTML 中可靠披露 Maria Carmen Staiano:机构信息未在 arXiv HTML 中可靠披露 Sukannya Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Adrian Cosma:机构信息未在 arXiv HTML 中可靠披露 Vitalii Babenko:机构信息未在 arXiv HTML 中可靠披露 Erivan Inan:机构信息未在 arXiv HTML 中可靠披露 Aviral Nigam:机构信息未在 arXiv HTML 中可靠披露 Wafa Aissa:机构信息未在 arXiv HTML 中可靠披露 Fatima Haouari:机构信息未在 arXiv HTML 中可靠披露 Venkata Prasanth Kumar Gummadi:机构信息未在 arXiv HTML 中可靠披露 Mehdi Jafarzadeh:机构信息未在 arXiv HTML 中可靠披露 Valentin Scourneau:机构信息未在 arXiv HTML 中可靠披露 Lukas Edman:机构信息未在 arXiv HTML 中可靠披露 Kaiser Sun:机构信息未在 arXiv HTML 中可靠披露 Shaomu Tan:机构信息未在 arXiv HTML 中可靠披露 Mohammad Sadegh Gholizadeh:机构信息未在 arXiv HTML 中可靠披露 Johannes-Rudolf David:机构信息未在 arXiv HTML 中可靠披露 Dipankar Srirag:机构信息未在 arXiv HTML 中可靠披露 Javier García Gilabert:机构信息未在 arXiv HTML 中可靠披露 Ruta Binkyte:机构信息未在 arXiv HTML 中可靠披露 Manar Ali:机构信息未在 arXiv HTML 中可靠披露 Ana-Maria Bucur:机构信息未在 arXiv HTML 中可靠披露 Sabry E. Farrag:机构信息未在 arXiv HTML 中可靠披露 Youssef Saber:机构信息未在 arXiv HTML 中可靠披露 Yihong Liu:机构信息未在 arXiv HTML 中可靠披露 Jean Maillard:机构信息未在 arXiv HTML 中可靠披露 Cojocaru Nicoleta:机构信息未在 arXiv HTML 中可靠披露 Xiaochuang Yuan:机构信息未在 arXiv HTML 中可靠披露 Sina Ahmadi:机构信息未在 arXiv HTML 中可靠披露 Philipp Mondorf:机构信息未在 arXiv HTML 中可靠披露 Kaustubh Dhole:机构信息未在 arXiv HTML 中可靠披露 Roman Wixinger:机构信息未在 arXiv HTML 中可靠披露 Shenbin Qian:机构信息未在 arXiv HTML 中可靠披露 Manuel Tuor:机构信息未在 arXiv HTML 中可靠披露 Sergey Troshin:机构信息未在 arXiv HTML 中可靠披露 Jonathan Yahav:机构信息未在 arXiv HTML 中可靠披露 Fida Mohammad Thoker:机构信息未在 arXiv HTML 中可靠披露 Amir Arsalan Rezapour:机构信息未在 arXiv HTML 中可靠披露 Lance Calvin Lim Gamboa:机构信息未在 arXiv HTML 中可靠披露 Manon Reusens:机构信息未在 arXiv HTML 中可靠披露 Kätriin Kukk:机构信息未在 arXiv HTML 中可靠披露 Koel Dutta Chowdhury:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把评价从整体印象分改为单样本可判定验证规则,用信息不对称缓解大语言模型(Large Language Model,LLM)既当选手又当裁判的自利偏差,思路干净且可诊断。短板是众包难例天然偏向猎奇、对抗与英文中心分布,对日常翻译质量代表性不足,规则质量与跨语言可比性仍高度依赖人工复核,迁移主张偏强。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1031 words

语音/音乐/音频论文速递 2026-09-04

语音/音乐/音频论文速递 2026-09-04 共分析 30 篇论文 ⚡ 今日概览 ✅ 筛选入选 30 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音增强 5 篇 █████ #语音合成 3 篇 ███ #语音交互 2 篇 ██ #语音质量评估 2 篇 ██ #声源定位 1 篇 █ #语音情感识别 1 篇 █ #语音编码 1 篇 █ 📊 论文评分排行榜(30 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ToolDF: Tool-Integrated Reasoning for Mixed… 8.4 前25% 方法研究 #音频伪造检测 🥈 Geometric Ceilings on Time-Frequency Masking for… 7.9 前25% 理论研究 #音乐源分离 🥉 CRAW: Codec Robust Audio Watermarking 7.7 前25% 方法研究 #音频水印 4. The 2026 PNPL Competition: Word Classification and… 7.5 前25% 数据集与基准 #语音识别 5. Test-time adaptation for speech enhancement with an… 7.5 前25% 方法研究 #语音增强 6. Alignment-Free Text-Audiobox for Voice Dubbing and… 7.5 前25% 系统技术报告 #语音合成 7. Listen to the Latents: Self-Correcting Speech… 7.2 前50% 方法研究 #语音识别 8. StreamWSR: Streamable and Lightweight Waveform-Domain… 7.2 前50% 方法研究 #语音增强 9. DuplexSpeechBench-IFEval: Evaluating Implicit… 7.2 前50% 数据集与基准 #语音交互 10. Building and Evaluating Fixed-Voice Thai TTS from… 7.2 前50% 系统技术报告 #语音合成 11. PACodec: A Low-bitrate Neural Speech Codec with… 7.1 前50% 方法研究 #语音编码 12. Decoupling Turn-Taking from Semantics: A Decoupled… 7.0 前50% 方法研究 #语音交互 13. Summary of the ChinaVoices Challenge 2026: Data, Tasks… 6.9 前50% 数据集与基准 #语音识别 14. The Attention Triangle in Audio-Video Models 6.9 前50% 方法研究 #音视频生成 15. Compressing Streaming Neural Audio Encoders via Latent… 6.9 前50% 方法研究 #语音识别 16. Dual-Form ASR: Semantics-Aware Inverse Text… 6.8 前50% 方法研究 #语音识别 17. Deep Neural Compression for RIR-Characterized Acoustic… 6.6 前50% 方法研究 #音频编码 18. SISER: Speaker-Invariant Speech Emotion Recognition… 6.5 前50% 方法研究 #语音情感识别 19. Masked Autoregressive Speech Enhancement with… 6.4 前50% 方法研究 #语音增强 20. Last Translation Benchmark 6.4 前50% 数据集与基准 #语音翻译 21. Neural Music Enhancement with Dual Time-Frequency… 6.2 前50% 方法研究 #语音增强 22. CAPQ-FAST: Content-Adaptive Perceived Quality… 6.2 前50% 应用研究 #音频质量评估 23. Beyond .WAV: Design and Software Verification of… 6.1 前50% 系统技术报告 #语音质量评估 24. Broadband Acoustic Intensity Direction Estimation with… 6.1 前50% 方法研究 #声源定位 25. Local Chord Corruption Is Not Recognizer Replay: Chord… 6.1 前50% 方法研究 #音乐生成 26. VoxReason: Listener-Free Evaluation of Source-Grounded… 5.9 前50% 数据集与基准 #语音合成 27. Is Semantics Enough for Speech Mean Opinion Score… 5.9 前50% 方法研究 #语音质量评估 28. Fairness Evaluation of Edge-AI Implementation for… 5.6 前50% 应用研究 #语音识别 29. StrixAE: An Intelligent Agent for Audio Enhancement… 5.5 前50% 系统技术报告 #语音增强 30. Opening mind by opening architecture: analysis… 4.5 后 50% 系统技术报告 #音频生成 📋 论文列表 🥇 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection ...

2026-09-04 · 更新于 2026-09-04 · 26 min · 5367 words

VAANI Noise Event Dataset: A curated spontaneous speech dataset annotated with timestamps for noise events

📄 在喇叭与犬吠同时响起时听清人声:VAANI 如何把印度田野噪声钉在时间轴上 英文题目:VAANI Noise Event Dataset: A curated spontaneous speech dataset annotated with timestamps for noise events 一句话:针对印度移动端自发语音中噪声与语音自然重叠却缺乏精确标注的难题,论文用原位录音加跨度级重叠时间戳与七类语义体系构建 72756 段 122.17 小时的标注层,最强证据是 106892 个事件的分布与双层质检规模,最大的代价是零基线验证与印地语高度集中。 标签:#语音识别 | #语音增强 | #多语言 评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Pavan Kumar J:机构信息未在 arXiv HTML 中可靠披露 Agneedh Basu:机构信息未在 arXiv HTML 中可靠披露 Pranav Bhat:机构信息未在 arXiv HTML 中可靠披露 Sujith Pulikodan:机构信息未在 arXiv HTML 中可靠披露 Suryansh Shukla:机构信息未在 arXiv HTML 中可靠披露 Nihar Desai Prasanta K. Ghosh:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把印度田野自发语音与重叠噪声起止时间配对记录,补上了合成混合与弱标签资源之间的空白,定位清晰。短板是全文零基线、零一致性量化、零下载链接,所谓支撑噪声鲁棒自动语音识别(Automatic Speech Recognition,ASR)、声音事件检测(Sound Event Detection,SED)与语音增强仍停留在宣称层面。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 948 words

Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech

📄 一句里换一种口音:用帧级掩码把全局引导切开 英文题目:Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech 一句话:针对句内码本切换中嵌入短语被载体口音同化的泄露问题,论文在离散扩散 TTS 的推理时用自注意力探测得到短语掩码并以独立尺度 λ 做语言对比引导,在 1200 条 12 方向合成语料上将嵌入短语语言准确率从 0.233 提至 0.518,代价是 UTMOS 轻度下降与需回退到 eager 注意力的 2.26 倍推理开销。 标签:#语音合成 | #扩散模型 | #语音克隆 | #多语言 | #零样本 评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Che Hyun Lee:Department of Electrical and Computer Engineering, Seoul National University Sangkwon Park:Department of Electrical and Computer Engineering, Seoul National University Donghun Kang:Department of Electrical and Computer Engineering, Seoul National University Dongwook Lee:Interdisciplinary Program in Artificial Intelligence, Seoul National University Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把全局分类器无关引导 Classifier-Free Guidance (CFG) 拆成帧级可控的语言对比引导,并用模型自注意力自举定位短语边界,实现了无训练的句内口音解耦,思路干净且与离散扩散的迭代去噪天然互补。短板是核心证据完全绑定在 OmniVoice 单一骨干和合成文本上,对自回归架构、真实自发码本切换及长时韵律连贯性的外推缺乏严格验证,推理侧需退回 eager 注意力导致的 2.26 倍开销也削弱了即插即用的说服力。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1693 words

TEIDAN: A Multilingual Multiparty Dialogue Corpus

📄 三个人怎么把话说完:TEIDAN 用统一的停顿尺子量出日英对话的节奏差 英文题目:TEIDAN: A Multilingual Multiparty Dialogue Corpus 一句话:TEIDAN 用三人围桌开放讨论与 200 毫秒为界的间歇单元统一采集日英多模态对话,通过过滤回馈后的伪轮次统计揭示英语长段陈述与日语增量协同的节奏分化,但受限于熟人度混淆与不足十小时的规模而只能作描述性对照。 标签:#多模态模型 | #多语言 | #数据集 评分:5.1/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Taiga Mori:Graduate School of Informatics, Kyoto University, Japan Koji Inoue:Graduate School of Informatics, Kyoto University, Japan Mikey Elmers:Graduate School of Informatics, Kyoto University, Japan Divesh Lala:Graduate School of Informatics, Kyoto University, Japan Tatsuya Kawahara:Graduate School of Informatics, Kyoto University, Japan 💬 毒舌点评 贡献在于首次以统一协议把自然三人围桌讨论做成可跨日英对照的多模态语料,并沿用 Corpus of Spontaneous Japanese(CSJ)的间歇单元(Inter-Pausal Unit,IPU,≥200 ms 静音为界)实现时间对齐转写,对多方轮替与指称研究确有填空价值;硬伤是总量仅 9 小时 46 分 57 秒、69 个会话,且跨语言对照在熟人-陌生人、话题数与会话时长上完全混淆,却仍做日英定量对比,尚未开放数据与基线模型,离可复用基准尚有距离。 ...

2026-09-02 · 更新于 2026-09-04 · 4 min · 777 words

语音/音乐/音频论文速递 2026-09-02

语音/音乐/音频论文速递 2026-09-02 共分析 23 篇论文 ⚡ 今日概览 ✅ 筛选入选 23 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频分类 3 篇 ███ #多模态模型 2 篇 ██ #语音合成 2 篇 ██ #语音增强 2 篇 ██ #语音情感识别 2 篇 ██ #音频分离 2 篇 ██ #语音交互 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(23 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 BiMTokenizer: Preserving Semantic-Acoustic Balance in… 8.3 前25% 方法研究 #语音编码 🥈 A Composable Evaluation System for Reproducible Omni… 8.3 前25% 系统技术报告 #多模态模型 🥉 Phrase-Localized Language-Contrastive Guidance… 8.2 前25% 方法研究 #语音合成 4. Zero-Shot Respiratory Sound Classification through LLM… 7.8 前25% 方法研究 #音频分类 5. A Unified Uncertainty-Aware Back-End for Speaker… 7.8 前25% 方法研究 #说话人验证 6. ABSE-NET: A Lightweight Neural Model for Active… 7.5 前25% 方法研究 #语音增强 7. TUTTI: Toward generalizable audio-to-score… 7.4 前50% 方法研究 #音乐转录 8. Perceptible or Not? Diagnosing Passive Fingerprints… 7.4 前50% 方法研究 #语音伪造检测 9. Ready to Speak: Aligning LLMs for TTS-Friendly Text… 7.4 前50% 方法研究 #语音合成 10. On the Human and Computer Alignment of Attribute-Based… 7.3 前50% 数据集与基准 #音乐检索 11. TimeSteer: Inference-Time Speech Scheduling in Joint… 7.2 前50% 方法研究 #音视频生成 12. VoiceLongMemEval: Do Assistants Remember How You… 7.1 前50% 数据集与基准 #语音情感识别 13. Cleaner Speech, Weaker Generalization: Revisiting Pitt… 7.0 前50% 数据集与基准 #音频分类 14. TAG-Bench: Benchmarking Temporal Audio Grounding in… 6.9 前50% 数据集与基准 #音频理解 15. Artificial Rosetta Stone: Constrained Maximum A… 6.8 前50% 方法研究 #音乐理解 16. XVAE-WMT: Explainable Wavelet-Temporal Variational… 6.6 前50% 方法研究 #音频分离 17. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U… 6.4 前50% 方法研究 #语音增强 18. Conversation Coach: A Voice-enabled AI System that… 6.3 前50% 系统技术报告 #语音交互 19. Soft Posterior Speaker Injection for Multi-Talker… 6.2 前50% 方法研究 #语音识别 20. Heard but Not Heeded: Paralinguistic Information… 6.0 前50% 方法研究 #语音情感识别 21. Ontology-based Target Sound Extraction 5.7 前50% 方法研究 #音频分离 22. MADS: A Multiview Acoustic Descriptor Set Beyond… 5.7 前50% 方法研究 #音频分类 23. TEIDAN: A Multilingual Multiparty Dialogue Corpus 5.1 后 50% 数据集与基准 #多模态模型 📋 论文列表 🥇 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling ...

2026-09-02 · 更新于 2026-09-04 · 24 min · 4954 words

Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages

📄 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages 一句话:针对转录稀缺导致解码器目标端先验不足的问题,SAMA-ASR 在冻结 Whisper 上插入语义-声学双锚点门控适配器,在 30 小时闽南语与客家语上以自动生成的普通话翻译锚点实现约 30% 与 19% 的相对 CER 下降,代价是依赖配对翻译与额外的 ST 推理开销。 标签:#语音识别 #Adapter #语音翻译 #低资源 #多语言 评分:8.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kuan-Tang Huang:National Taiwan Normal University, Taiwan;EZAI, Taiwan Cheng-Yeh Yang:National Taiwan Normal University, Taiwan Chien-Chun Wang:National Taiwan Normal University, Taiwan Hung-Shin Lee:National Taiwan Normal University, Taiwan Hsin-Min Wang:Academia Sinica, Taiwan Berlin Chen:National Taiwan Normal University, Taiwan 💬 毒舌点评 亮点在于把低资源自动语音识别(Automatic Speech Recognition,ASR)重新定义为目标端生成证据不足问题,并用冻结骨干加语义-声学双锚点门控适配器的极简设计同时解决语义引导与声学落地,消融与冷启动分析相当扎实。短板是验证仅限两套汉语方言且依赖配对普通话翻译,极低资源与弱翻译器下的失效边界已被作者自行暴露,跨语系泛化与真实无配对场景的可用性仍存疑。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1582 words

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

📄 当模型听得懂阿拉伯语,却看不懂阿拉伯文化:ImageEval 2026 的三重拷问 英文题目:ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation 一句话:ImageEval 2026 把口语视觉问答、对比式幻觉检测与参考图锚定的文生图文化评分放进同一阿英双语基准,用合成到真人的语音域偏移和五档 caption 梯度撕开现有模型的文化盲区,却也暴露了小样本与结构先验可被利用的代价。 标签:#语音识别 #多模态模型 #基准测试 #多语言 评分:8.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Samir Abdaljalil:Texas A&M University Hunzalah Hassan Bhatti:Qatar Computing Research Institute, Qatar Ahlam Bashiti:Birzeit University, Palestine Farina Amir:Hamad Bin Khalifa University, Qatar Md Arid Hasan:University of Toronto, Canada Basel Mousi:Qatar Computing Research Institute, Qatar Nadir Durrani:Qatar Computing Research Institute, Qatar Fahim Dalvi:Qatar Computing Research Institute, Qatar Zien Sheikh Ali:Qatar Computing Research Institute, Qatar Erchin Serpedin:Texas A&M University Hasan Kurban:Hamad Bin Khalifa University, Qatar Mustafa Jarrar:Hamad Bin Khalifa University, Qatar Shammur Absar Chowdhury:Qatar Computing Research Institute, Qatar Firoj Alam:Qatar Computing Research Institute, Qatar 💬 毒舌点评 亮点在于把阿拉伯语口语视觉问答(Spoken VQA)、幻觉检测与文化敏感的文生图评测打包成统一双语基准,并用真实人声测试集撕开了合成语音训练的遮羞布。短板是 CRAI-Bench 仅用 40 张参考图和单一生成模型,却让标题版本号这种结构先验就能刷到第一,文化评估的视觉 grounding 几乎被架空。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1395 words