论文解读

声音里有喘息却只听文字说没事:CliniCAST 测音频分诊的文本主导

论文用固定文字、只改声音的合成对照测音频语言模型能否把可听症状用于分诊,最强证据是高风险声音配安心文字时多数模型仍跟文字走,而代价是大量平局与无效输出且声学敏感度随疾病和模型剧烈波动。

 · 更新于 2026-09-24 · 约 21 分钟 · 10052 字 阅读 →
论文解读

病理语音遮住编解码痕迹时,如何仍能检出伪造

针对病理语音下神经音频编解码重合成伪造难以检出的问题,论文构建配对的中英多病症基准并提出保留多证据、在双曲空间用多原型建模伪造模式的 PHOENIX-Mamba,其 PaSST 版本在英抑郁等任务上达到 97.04 准确率并把等错率降到约 5 左右,代价是依赖预训练表示与受控重合成协议而未覆盖真实信道与 TTS 等攻击。

 · 更新于 2026-09-24 · 约 22 分钟 · 10630 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

把医学知识先教给文字大脑,再用少量语音对齐:SpeechMedAssist 的两阶段医疗问诊适配

针对医疗语音数据稀缺与问诊能力缺失问题,论文用 405k 文本注入知识再用 198k 合成语音做模态重对齐,在多轮问诊与单轮问答上报告最优分数,代价是仍以普通话合成为主且只验证文本语音两种模态。

 · 更新于 2026-09-24 · 约 19 分钟 · 9049 字 阅读 →
论文解读

为每段呼吸声选增强:PASA 用两阶段混合策略平衡效率与个性化

针对听诊数据稀缺且正常与异常声音频谱特性不同,PASA 把增强选择建模为马尔可夫决策过程并用混合批量-样本策略执行,在三个基准上提升诊断分数,但个性化依赖验证集奖励与样本统计积累,计算代价高于固定增强。

 · 更新于 2026-09-24 · 约 25 分钟 · 12377 字 阅读 →
论文解读

从贴标签到写病程:用情绪—认知描述统一多模态心理健康评估

针对分类法缺解释、纯文本大模型漏掉表情语调的问题,该研究提出情绪—认知协同多模态描述任务并用双路 BridgeNet 加 LLaMA 生成描述,在 MMDA 上描述指标领先且生成的画像把抑郁焦虑辅助判断的准确率平均提升超 12 个百分点,代价是两阶段训练与自动标注依赖人工清洗。

 · 更新于 2026-09-24 · 约 18 分钟 · 8982 字 阅读 →
论文解读

不只收一个 WAV:把浏览器采集与变换留证的录音系统

VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。

 · 更新于 2026-09-24 · 约 19 分钟 · 9021 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19562 字 阅读 →
论文解读

一个人、一套配方、七种适配器:重度构音障碍识别该押注哪种微调

语音识别 | 5.9/10

 · 更新于 2026-09-24 · 约 22 分钟 · 11018 字 阅读 →
论文解读

孤独听得出来吗:当说什么比怎么说更诚实

语音情感识别 | 4.9/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8019 字 阅读 →
论文解读

关掉麦克风不行,擦掉人声才行:助老监听的隐私防火墙

音频分类 | 5.9/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12221 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 49 分钟 · 24532 字 阅读 →
论文解读

单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作

音频分离 | 6.6/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12996 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34077 字 阅读 →
论文解读

在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住

语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10440 字 阅读 →
论文解读

把咳嗽声拆开:用高斯对齐让模型忘记敏感属性

音频分类 | 5.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10348 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 151 分钟 · 75584 字 阅读 →
论文解读

把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗

语音增强 | 6.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8494 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 66 分钟 · 32614 字 阅读 →
论文解读

咳嗽不是噪声:让对话智能体在轮次间听见呼吸

音频事件检测 | 6.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7497 字 阅读 →