Mandarin Humorous Homophone Recognition and Disambiguation in Automatic Speech Recognition

📄 谐音不是错字:让普通话 ASR 在纠错与保留笑点之间踩刹车 英文题目:Mandarin Humorous Homophone Recognition and Disambiguation in Automatic Speech Recognition 一句话:这篇论文把高频字改对和别把故意反常的谐音笑点抹平拆为双支路,用 span 定位、条件提示与不同的语义选择规则分担矛盾;低频收益、高频退化和 80 条 TTS HumourPhone 共同说明保守路由仍未被充分验证。 标签:#语音识别 #大语言模型 #Adapter #提示学习 #模型评估 评分:5.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.6/1.5 💬 毒舌点评 该工作真正做对的不是再增加泛化提示词,而是承认纠错和识别笑点的判据相反:常规支路用 5% 相对裕量保留原转写,HumourPhone 支路则允许保留合乎模式的语义不协调。Whisper-v3 的低频靶词 T-CER 从 24.74% 到 20.39%说明,先圈定可疑 span 再局部改写,比让语音 LLM 对整句即兴发挥更有纪律。 但最难的现实部分只有 80 条、0.08 小时的 Edge TTS 语料,也没有拆开 Emotion Detector、span 扩展、LLM 生成和 MacBERT 选择器的贡献。Qwen3-ASR 高频组从 2.19% 升到 3.42%,Prompt 4 又从 13.88% 回升到 14.04%;这提醒我们,知道哪里可能有梗,离知道何时绝不能动原句,仍缺少被实测的置信度策略。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 643 words

Multi-Modal Generative Fuzzy System: Fuzzy Inference Guided Large Model Interactive Question Answering Framework

📄 Multi-Modal Generative Fuzzy System: Fuzzy Inference Guided Large Model Interactive Question Answering Framework 标签:#音视频问答 #多模态模型 #提示学习 #可解释性 #基准测试 5.9/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 0.4/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频问答 | #多模态模型 | #提示学习 #可解释性 | arxiv 👥 作者与机构 第一作者:Hailong Yang(江南大学人工智能与计算机学院;智慧医疗信息技术教育部工程研究中心) 通讯作者:Zhaohong Deng(江南大学人工智能与计算机学院;智慧医疗信息技术教育部工程研究中心) 作者列表:Hailong Yang(江南大学人工智能与计算机学院;智慧医疗信息技术教育部工程研究中心)、Jianqi Wang(江南大学人工智能与计算机学院;智慧医疗信息技术教育部工程研究中心)、Guanjin Wang(Murdoch University, School of Information Technology)、Zhaohong Deng(江南大学人工智能与计算机学院;智慧医疗信息技术教育部工程研究中心) 💡 毒舌点评 本文把模糊系统思想包装成多智能体 LLM 交互框架,提出“生成式模糊规则”和多跳规则推理,消融与多数据集对比做得较完整,确实比若干现有多模态 QA 方法有整体提升。但“模糊推理”本质上仍是自然语言等级投票与提示工程,缺乏真正可学习隶属函数或去模糊化机制;与最强基线相比提升很小,个别指标甚至倒退(WebQA BLEU 低 0.02、BioMol-MQA Recall 低 1.45、EHRxQA Recall 低 0.08),核心鲁棒性与可解释性声明因此显得过强。严格来说,这是一个带规则化多智能体的提示工程系统,而不是真正的模糊系统。 ...

2026-08-18 · 更新于 2026-09-04 · 3 min · 567 words

MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model

📄 MazzikaAI: A knowledge-based performance-to-prompt compiler for real-time Arabic maqam accompaniment with a streaming text-to-music model 标签:#音乐生成 #提示学习 #多模态模型 6.6/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #提示学习 | #多模态模型 | arxiv 👥 作者与机构 Jiaxin Du, Boulbaba Abdeljaouad, Yong Zhuang, Haoyu Li;单位均为 Grand Valley State University(美国密歇根州阿伦代尔)。论文标注投稿至 Expert Systems with Applications。 ...

2026-08-12 · 更新于 2026-09-04 · 3 min · 519 words

The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials

📄 The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials 标签:#医疗音频 #大语言模型 #多任务学习 #提示学习 #工业应用 5.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 📝 5.8/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #医疗音频 | #大语言模型 | #多任务学习 #提示学习 | arxiv 👥 作者与机构 第一作者:Mila Fodor、Katalin Ócsai(共同第一作者,均来自 Clario, part of Thermo Fisher Scientific) 通讯作者:Francesco Periti(Clario, part of Thermo Fisher Scientific) 其他作者:Rien Sonck, Alex Boudreau(均来自 Clario, part of Thermo Fisher Scientific) 所有作者均来自同一工业研究机构,无学术机构合作。 💡 毒舌点评 这篇论文把一个ASR+LLM+RandForest的组合拳打在了SIGMA指导的抑郁临床试验上,工程集成度不错,在内部数据上相关性跑到了0.867。但严格来说,它造了一个“又聋又哑”的评估者——丢弃所有语音声学信号,只啃文本,而临床医生恰恰会利用韵律、停顿等副语言信息做判断。更致命的是,数据全封闭、模型全封闭,第三方连WER这种基本指标都验证不了,使得这篇论文更偏向一份Clario公司的技术白皮书,而非可复现的科学文献。 ...

2026-07-31 · 更新于 2026-09-04 · 3 min · 557 words

Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

📄 Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis 标签:#音频交互 #提示学习 #音频大模型 #音频理解 #Transformer 7.0/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频交互 | #提示学习 | #音频大模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Jiachen Qian(City University of Hong Kong) 第二作者:Junyu Li(City University of Hong Kong (Dongguan)) 通讯作者:未说明 其他作者信息:无 💡 毒舌点评 这篇论文用一个干净利落的受控实验,把音频LLM安全评测中“文本和语音传递混为一谈”的致命问题拎了出来——固定有害文本,只靠变韵律就能让越狱成功率从4%飙到40%,这个insight足够让只会做文本红队的人冒冷汗。但很可惜,作者为了“防滥用”把整个数据集和代码藏得严严实实,读者只能靠一份“食谱”自己在家复刻,而这“食谱”又深度绑定Azure TTS和特定的说话人预设,换个TTS引擎效果还剩多少完全靠猜。此外,机理分析虽然画了漂亮的“拒绝方向”箭头,但更像是给现象贴了个几何外观的标签,离真正的因果解释还隔着好几层。 ...

2026-07-30 · 更新于 2026-09-04 · 3 min · 460 words

Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer

📄 Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer 标签:#语音合成 #提示学习 #大语言模型 #语音交互 #高效推理 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #提示学习 | #大语言模型 #语音交互 | arxiv 👥 作者与机构 第一作者:Shengfan Shen(所属机构:MiLM Plus, Xiaomi Inc., China 和 HNU – Hunan University,邮箱shenshengfan@hnu.edu.cn) 通讯作者:Shuai Wang(南京大学,邮箱shuaiwang@nju.edu.cn) 作者列表:Shengfan Shen(MiLM Plus, Xiaomi Inc. 和 HNU – Hunan University)、Di Wu(MiLM Plus, Xiaomi Inc.)、Xingchen Song(MiLM Plus, Xiaomi Inc.)、Dinghao Zhou(MiLM Plus, Xiaomi Inc.)、Pengyu Cheng(MiLM Plus, Xiaomi Inc.)、Sixiang Lyu(MiLM Plus, Xiaomi Inc.)、Jian Luan(MiLM Plus, Xiaomi Inc.)、Shuai Wang(南京大学)。其他作者(Di Wu 至 Jian Luan)所属机构均标注为 MiLM Plus, Xiaomi Inc., China。此外,作者列表前注明了 WeNet Open Source Community。 💡 毒舌点评 这篇论文将TTS的风格控制问题成功地简化为一个工程上可解的封闭集路由问题,并在工业界常用的TTS引擎上验证了其可行性和初步效果,工程实用价值突出。然而,其核心创新在于系统集成与问题重构,而非底层算法或模型上的突破;评估体系完全依赖教师模型生成的“真值”,且不开源任何核心组件,使得其学术贡献的可信度与可复现性大打折扣,更像是一个内部技术方案的初步报告。 ...

2026-07-21 · 更新于 2026-09-04 · 3 min · 562 words

When to Use Extra Context: Evidence-Grounded Terminology Adaptation for Simultaneous Speech Translation

📄 When to Use Extra Context: Evidence-Grounded Terminology Adaptation for Simultaneous Speech Translation 标签:#语音翻译 #提示学习 #流式处理 #音频理解 #Transformer 6.7/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音翻译 | #提示学习 | #流式处理 #音频理解 | arxiv 👥 作者与机构 第一作者:Zeyu Yang(香港中文大学(深圳)) 通讯作者:Zeyu Yang(香港中文大学(深圳)) 作者列表:Zeyu Yang(香港中文大学(深圳))、Satoshi Nakamura(香港中文大学(深圳)) 💡 毒舌点评 论文的亮点在于洞察精准——将上下文收益归结于术语恢复而非通用语义增强,并且将其实现为轻量的推理时框架。shuffled-memory控制实验设计严谨,有效地验证了性能提升源于与正确证据的对齐,而非通用偏向。短板也很明显:核心组件“术语提取器”是一个闭源的大语言模型API(Qwen3-30B-Instruct),其准确性、偏差和可复现性是硬伤。验证数据集规模有限且场景高度特化(ACL技术会议),在更通用或低资源场景下的价值存疑。方法高度依赖文档级上下文质量,这限制了其适用范围。 ...

2026-07-21 · 更新于 2026-09-04 · 2 min · 321 words

Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation

📄 Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation 标签:#提示学习 #开源工具 #音频理解 #Transformer #模型评估 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 6.1/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #提示学习 | #Transformer | #开源工具 #音频理解 | arxiv 👥 作者与机构 第一作者:Song-Ze Yu(加州大学伯克利分校) 通讯作者:未说明 作者列表:Song-Ze Yu(加州大学伯克利分校)、Joseph Suh(加州大学伯克利分校)、Serina Chang(加州大学伯克利分校)、David M. Chan(加州大学伯克利分校) 💡 毒舌点评 论文成功将前沿的“叙事背景条件化”方法包装成对非技术用户友好的开源平台,工程完成度高,实用价值明确。然而,其核心科学贡献更接近于一个优秀的系统集成和工程实现,而非方法论本身的原创性突破。评估深度不足,停留在复制已有案例研究的层面,且作为平台报告,对新引入的概率匹配算法、多模态支持等关键特性缺乏深入的消融分析和量化比较,削弱了其方法论贡献的说服力。 ...

2026-07-14 · 更新于 2026-09-04 · 3 min · 538 words

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

📄 CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection 标签:#Transformer #提示学习 #多模态模型 #大语言模型 #零样本 8.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #提示学习 | #Transformer | #多模态模型 #大语言模型 | arxiv 👥 作者与机构 第一作者:Qiyang Sun (Imperial College London, GLAM) 通讯作者:Yi Chang (Imperial College London, GLAM), Zixing Zhang (Hunan University, Shenzhen Research Institute) 作者列表: Qiyang Sun (Imperial College London, GLAM) Yi Chang (Imperial College London, GLAM) Yupei Li (Imperial College London, GLAM) Xi Shao (Nanjing University of Posts and Telecommunications) Zixing Zhang (Hunan University, Shenzhen Research Institute) Björn W. Schuller (Imperial College London, GLAM; TUM University Hospital; relAI; MDSI; MCML) 💡 毒舌点评 论文针对LLM在零样本讽刺检测中固有的“阳性偏见”这一关键痛点,提出了“双向电荷校准”的巧妙方法,并通过“声学后融合”来弥补纯文本的不足,问题抓得准,实验设计扎实且结果显著。然而,其声称的“训练无关”框架在第二阶段(ALFR)实际上严重依赖一个在目标数据集上训练的浅层分类器,且整个推理流程(多提示、多采样、多轮LLM调用)成本高昂,与“训练无关”的轻量化初衷存在张力。 ...

2026-07-14 · 更新于 2026-09-04 · 5 min · 1065 words

ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions

📄 ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions #语音合成 #说话人验证 #生成模型 #提示学习 7.6/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.8/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | #语音合成 | #生成模型 | #说话人验证 #提示学习 | arxiv 👥 作者与机构 第一作者:Thomas Thebaud(Johns Hopkins University) 通讯作者:未说明 作者列表:Thomas Thebaud、Junhyeok Lee、Laureano Moro-Velazquez、Jesus Villalba Lopez、Najim Dehak,均隶属于 Johns Hopkins University 💡 毒舌点评 亮点是用自然语言直接描述说话人特征并生成完整的x-vector分布,而非单一向量,为可控语音合成提供了更灵活的接口。短板同样明显:最关键的对比方法PromptSpeaker被优雅地留在Related Work中谈论区别,却从未出现在任何一张实验表格里,这种避实就虚的做法几乎让整个比较性论述沦为纸上谈兵;韵律属性的控制名存实亡——pitch和pace的生成准确率断崖式下跌,而tone的准确率仅靠“比真实数据还高”这点可怜的优势撑门面,这几乎让“全面描述一个说话人”的愿景成为一个残酷的玩笑。整体上,这是一个架构设计有趣、但实验验证远未闭环的中间件原型。 ...

2026-07-07 · 更新于 2026-09-04 · 2 min · 342 words