SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper for Low-Resource Nepali Financial Speech Recognition

📄 念对了也白搭:尼泊尔金融语音里被格式卡住的钱包 英文题目:SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper for Low-Resource Nepali Financial Speech Recognition 一句话:针对通用尼泊尔语识别在金融指令上数字全错且输出写法无法解析的问题,该工作用 403 条金融语音加 LoRA 适配 Whisper large-v2,把 WER 指标从 WER 129.95% 降到 WER 42.58%,把 TSR 指标从 TSR 1.67% 提到 TSR 33.33%,代价是绝对成功率仍远离支付可用线且测试仅 60 条。 标签:#语音识别 | #参数高效微调 | #低资源 评分:6.1/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Biraj Subedi:Independent Researcher 💬 毒舌点评 把低资源金融语音的领域失配讲清楚并配了可部署链路,诚实到连说话人重叠和分类漏洞都自曝。短板在于 60 条测试集要撑起 20 倍任务增益的故事,绝对性能仍远离可用线,更像扎实的应用报告而非顶会方法突破。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 923 words

VAANI Noise Event Dataset: A curated spontaneous speech dataset annotated with timestamps for noise events

📄 在喇叭与犬吠同时响起时听清人声:VAANI 如何把印度田野噪声钉在时间轴上 英文题目:VAANI Noise Event Dataset: A curated spontaneous speech dataset annotated with timestamps for noise events 一句话:针对印度移动端自发语音中噪声与语音自然重叠却缺乏精确标注的难题,论文用原位录音加跨度级重叠时间戳与七类语义体系构建 72756 段 122.17 小时的标注层,最强证据是 106892 个事件的分布与双层质检规模,最大的代价是零基线验证与印地语高度集中。 标签:#语音识别 | #语音增强 | #多语言 评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Pavan Kumar J:机构信息未在 arXiv HTML 中可靠披露 Agneedh Basu:机构信息未在 arXiv HTML 中可靠披露 Pranav Bhat:机构信息未在 arXiv HTML 中可靠披露 Sujith Pulikodan:机构信息未在 arXiv HTML 中可靠披露 Suryansh Shukla:机构信息未在 arXiv HTML 中可靠披露 Nihar Desai Prasanta K. Ghosh:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把印度田野自发语音与重叠噪声起止时间配对记录,补上了合成混合与弱标签资源之间的空白,定位清晰。短板是全文零基线、零一致性量化、零下载链接,所谓支撑噪声鲁棒自动语音识别(Automatic Speech Recognition,ASR)、声音事件检测(Sound Event Detection,SED)与语音增强仍停留在宣称层面。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 948 words

VibeVoice-ASR-Streaming Technical Report

📄 边听边分清谁在说:把长历史留下来做说话人归属 英文题目:VibeVoice-ASR-Streaming Technical Report 一句话:针对流式会议转录要同时低延迟输出文字与说话人标签的难题,论文把固定块加前视与历史交错放入单一自回归上下文,用 7B 模型在五集合均值与 12 个归属设置上取得最优,代价是 8 分钟上限与首包更慢。 标签:#语音识别 | #语音大模型 | #说话人日志 | #流式处理 | #会议转录 评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yujie Tu:University of Chinese Academy of Sciences Zhiliang Peng:Microsoft Research Jianwei Yu:Microsoft Research Li Dong:Microsoft Research Songchen Xu:Shanghai Jiao Tong University Yaoyao Chang:Microsoft Research Wenhui Wang:Microsoft Research Zilong Wang:Microsoft Research Zehua Wang:Microsoft Research Yan Xia:Microsoft Research Jiajun Zhang:University of Chinese Academy of Sciences Xie Chen:Shanghai Jiao Tong University Furu Wei:Microsoft Research 💬 毒舌点评 把长历史保留在自回归上下文里来固定说话人身份是漂亮而务实的选择,云端对比的延迟与代价测量也难得诚实。但序列化单流输出对长时重叠的妥协、八分钟上限与首包延迟问题让实时声称打了折,技术报告仍更像强工程而非范式突破。 ...

2026-09-03 · 更新于 2026-09-04 · 2 min · 294 words

Soft Posterior Speaker Injection for Multi-Talker Speech Recognition

📄 不做硬切分:用连续说话人占比给 Whisper 注入重叠感知 英文题目:Soft Posterior Speaker Injection for Multi-Talker Speech Recognition 一句话:针对重叠语音下硬切分会不可逆截断语音的问题,论文用混合归一化的连续说话人占比通过多层 FiLM 与解码器记忆提示注入 Whisper,在受控双说话人合成集上相对同骨干 SOT 降低 1.1 个点 cpWER 且在高重叠区间增益更大,但在 LibriCSS 零样本上与基线持平、仅靠冻结后验的重叠富集适配才拉开差距,代价是两遍编码的推理开销。 标签:#语音识别 | #语音大模型 | #说话人日志 评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Jian Zhu:机构信息未在 arXiv HTML 中可靠披露 Cheng Luo:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用连续的混合归一化说话人占比代替硬切分,通过多层特征线性调制(Feature-wise Linear Modulation,FiLM)与解码器记忆提示的互补注入,在可控重叠上做出统计显著的小幅提升并设计了冻结后验的域迁移策略。短板是核心增益仅 1.1 个点且依赖合成数据的能量比软标签与两遍编码,零样本在真实 LibriCSS 上与基线持平,整体仍是 Whisper-medium 上的精巧插件而非可扩展的多说话人范式。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1467 words

Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages

📄 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages 一句话:针对转录稀缺导致解码器目标端先验不足的问题,SAMA-ASR 在冻结 Whisper 上插入语义-声学双锚点门控适配器,在 30 小时闽南语与客家语上以自动生成的普通话翻译锚点实现约 30% 与 19% 的相对 CER 下降,代价是依赖配对翻译与额外的 ST 推理开销。 标签:#语音识别 #Adapter #语音翻译 #低资源 #多语言 评分:8.4/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kuan-Tang Huang:National Taiwan Normal University, Taiwan;EZAI, Taiwan Cheng-Yeh Yang:National Taiwan Normal University, Taiwan Chien-Chun Wang:National Taiwan Normal University, Taiwan Hung-Shin Lee:National Taiwan Normal University, Taiwan Hsin-Min Wang:Academia Sinica, Taiwan Berlin Chen:National Taiwan Normal University, Taiwan 💬 毒舌点评 亮点在于把低资源自动语音识别(Automatic Speech Recognition,ASR)重新定义为目标端生成证据不足问题,并用冻结骨干加语义-声学双锚点门控适配器的极简设计同时解决语义引导与声学落地,消融与冷启动分析相当扎实。短板是验证仅限两套汉语方言且依赖配对普通话翻译,极低资源与弱翻译器下的失效边界已被作者自行暴露,跨语系泛化与真实无配对场景的可用性仍存疑。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1582 words

Conjoint Audio-to-Spikes Encoding and Processing for Efficient Neuromorphic Speech Recognition

📄 用最轻的耳蜗换最高的精度:HLP 脉冲编码为何在干净数据上赢、在嘈杂数据上输 英文题目:Conjoint Audio-to-Spikes Encoding and Processing for Efficient Neuromorphic Speech Recognition 一句话:论文用仅靠阈值调控脉冲密度的可编程 Butterworth 滤波器组与 IF 神经元构成非可学习 HLP 编码器,配合 100 步累积器与前馈 SNN 联合优化,在 Heidelberg Digits 上以 13 通道 100k 参数达到 99.77% 超越同类流水线,却在多说话人 GSC 上暴露对异构噪声鲁棒性不足的代价,并以 Zynq-7000 定点化 LLP 实现验证在线可行性。 标签:#语音识别 #端到端 #音频分类 #高效推理 评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Valentin M. Meunier:机构信息未在 arXiv HTML 中可靠披露 Amélie Gruel:机构信息未在 arXiv HTML 中可靠披露 Pierre Lewden:机构信息未在 arXiv HTML 中可靠披露 Adrien F. Vincent:机构信息未在 arXiv HTML 中可靠披露 Sylvain Saïghi:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把高层可编程滤波器组与积分发放神经元绑定的轻量编码器做到了可在 FPGA 上端到端跑通,并在受控的 Heidelberg Digits 上以极简前馈脉冲网络刷出超高精度,工程闭环完整。短板是复杂多说话人场景下泛化明显掉队,NTIMIT 仅 63.98% 且 GSC 远落后于 Lauscher 与 Speech2Spikes 的同类流水线,却未给出每通道阈值或更强时序建模等实质补救验证,效率指标也停留在脉冲计数层面。 ...

2026-09-01 · 更新于 2026-09-04 · 10 min · 2109 words

Context-Aware Interleaved Batching for WhisperX

📄 在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住 英文题目:Context-Aware Interleaved Batching for WhisperX 一句话:面对长音频转写中并行速度与跨段上下文不可兼得的矛盾,论文用 VAD 固定声学边界并以轮询交错批处理恢复 224 词元滚动上下文,在 Earnings-21 上以 8.4 倍于串行 Whisper 的速度将 WER 降至 8.2%、专有名词分数提至 79.3%,代价是首批重转的一次额外前向与小规模评测的不确定性。 标签:#语音识别 #语音大模型 #长音频处理 #高效推理 #医疗音频 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Carlos Bain:机构信息未在 arXiv HTML 中可靠披露 Max Bain:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用语音活动检测(Voice Activity Detection,VAD)外置边界加流间轮询批处理把 Whisper 的 224 词元历史条件从串行枷锁里解放出来,思路巧妙且可直接插进任意分段式流水线。问题在于评测仅靠 15 条 Earnings-21 与 6 条自建 MedicalLessons,基于 GPT-5.1 的 LPS 与 Pn 均无人工一致性校准,8.4 倍加速背后首批重转的额外前向与 N≤B 时退化为近串行的代价也被轻描淡写。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1342 words

HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding

📄 听见是谁在说:用反事实声纹逼语音模型从猜文本回到听声音 英文题目:HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding 一句话:针对多说话人场景下语音模型靠语义先验猜测谁说了什么的问题,论文以 Erber 听觉层级构建 HEAR 诊断基准与声纹交换的 CASH 硬负样本,并用转录优先的 GRPO 训练 A2R,在配对评估与三项零样本迁移上显著提升声学接地,代价是显式转录带来的延迟与合成分布局限。 标签:#说话人日志 #强化学习 #语音识别 #音频理解 #基准测试 评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Dongwook Lee:IPAI, Seoul National University (SNU) Sangkwon Park:Department of ECE, SNU Eunwoo Song:Department of EE, Yonsei University Che Hyun Lee:Department of ECE, SNU Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Junho Kim:机构信息未在 arXiv HTML 中可靠披露 June Young Yi:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用反事实语音克隆把语义先验与声学身份彻底解耦,配上配对评估让依赖文本捷径的模型无处遁形,诊断非常犀利。短板是 CASH 完全依赖合成语音构建 hard negative,且仅在 Qwen3-Omni 单一基座上验证 GRPO 收益,对真实声学多样性和架构泛化性的说服力仍显单薄。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1590 words

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

📄 当模型听得懂阿拉伯语,却看不懂阿拉伯文化:ImageEval 2026 的三重拷问 英文题目:ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation 一句话:ImageEval 2026 把口语视觉问答、对比式幻觉检测与参考图锚定的文生图文化评分放进同一阿英双语基准,用合成到真人的语音域偏移和五档 caption 梯度撕开现有模型的文化盲区,却也暴露了小样本与结构先验可被利用的代价。 标签:#语音识别 #多模态模型 #基准测试 #多语言 评分:8.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Samir Abdaljalil:Texas A&M University Hunzalah Hassan Bhatti:Qatar Computing Research Institute, Qatar Ahlam Bashiti:Birzeit University, Palestine Farina Amir:Hamad Bin Khalifa University, Qatar Md Arid Hasan:University of Toronto, Canada Basel Mousi:Qatar Computing Research Institute, Qatar Nadir Durrani:Qatar Computing Research Institute, Qatar Fahim Dalvi:Qatar Computing Research Institute, Qatar Zien Sheikh Ali:Qatar Computing Research Institute, Qatar Erchin Serpedin:Texas A&M University Hasan Kurban:Hamad Bin Khalifa University, Qatar Mustafa Jarrar:Hamad Bin Khalifa University, Qatar Shammur Absar Chowdhury:Qatar Computing Research Institute, Qatar Firoj Alam:Qatar Computing Research Institute, Qatar 💬 毒舌点评 亮点在于把阿拉伯语口语视觉问答(Spoken VQA)、幻觉检测与文化敏感的文生图评测打包成统一双语基准,并用真实人声测试集撕开了合成语音训练的遮羞布。短板是 CRAI-Bench 仅用 40 张参考图和单一生成模型,却让标题版本号这种结构先验就能刷到第一,文化评估的视觉 grounding 几乎被架空。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1395 words

Likelihood-Constrained Acoustic Reranking for Training-Free Hallucination Mitigation in LLM-Based ASR

📄 给大模型加声学缰绳:用 0.6 nats 的似然约束把翻译式幻觉拉回转录 英文题目:Likelihood-Constrained Acoustic Reranking for Training-Free Hallucination Mitigation in LLM-Based ASR 一句话:针对 LLM-based ASR 在代码切换与指令注入下把转录做成翻译或执行的声学失接地问题,LCAR 在每步只保留与贪心 token 差距 0.60 nats 内的候选再用注意力池化的声学兼容度重排,在四套已部署系统上以约 4.0% token 切换率移除 38.8% 至 57.1% 幻觉且 LibriSpeech 与 AISHELL2 上 WER 与 CER 几乎不变。 标签:#语音识别 #语音大模型 #多语言 #鲁棒性 #基准测试 评分:7.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1509 words