论文解读

不只收一个 WAV:把浏览器采集与变换留证的录音系统

VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。

 · 更新于 2026-09-25 · 约 19 分钟 · 9021 字 阅读 →
论文解读

用成对心形麦克风测声强方向:紧框架阵列为何能做到 50 Hz 到 20 kHz

论文用消声室实测脉冲响应验证成对心形传声器的声强测向,在 50 Hz 到 20 kHz 内比较 TF24 与 TF6 和 20mm 与 100mm 间距,最强证据是 20mm 的 TF24 在干扰信号比 -20 dB 和 -30 dB 时全频段中值跟踪误差在 2.5 度以内,代价是大间距高频和强干扰下误差明显增大且存在与波长相关的峰。

 · 更新于 2026-09-25 · 约 20 分钟 · 9881 字 阅读 →
论文解读

说了是谁还不够:全双工语音智能体能否在正确时刻做对地板动作

论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。

 · 更新于 2026-09-25 · 约 17 分钟 · 8224 字 阅读 →
论文解读

实增益掩蔽的天花板是投影,离开直线却赢不回平方误差

论文刻画单通道时频实增益掩蔽的正交投影上限,并用一个高斯混合后验均值估计器研究先验、读出与相位对称性:长窗留出设置下估计器距实测类上界 11.44 dB,校准分析中的约 70% 是分贝缺口之比,不是全部缺口或误差能量都由后验方差解释,更不是所有生成分离器的性能上限。

 · 更新于 2026-09-25 · 约 18 分钟 · 8687 字 阅读 →
论文解读

卡住最强翻译模型:难例众包与逐条验证规则

该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。

 · 更新于 2026-09-25 · 约 22 分钟 · 10621 字 阅读 →
论文解读

耦合失真下不换模型而换管线:StrixAE 用智能体调度专家模型

针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。

 · 更新于 2026-09-25 · 约 22 分钟 · 10852 字 阅读 →
论文解读

十六种方言同一套音频:辨别与转写为何难同步提升

该挑战用同一批十六类方言音频同时考辨别与转写,统一基线仅 53.62% 辨别准确率与 18.10% 转写错误率,最强受限系统做到 83.19% 与 11.08%,而困难方言与混淆方向显示两任务相关但不可互相替代。

 · 更新于 2026-09-25 · 约 20 分钟 · 9576 字 阅读 →
论文解读

从听见一个词到认出一个词:LibriBrain100 如何把词分类与跨人泛化变成可比的竞赛

论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。

 · 更新于 2026-09-25 · 约 20 分钟 · 9708 字 阅读 →
论文解读

合成之前先对账:说话计划能否证明 delivery 真用了源记录

论文把合成前 delivery 决策做成带源引用的结构化说话计划,用确定性校验器检查引用合法性与单线索局部性,在 32 种子 100 例 full100 对照中去掉源记录使引用必需分数下降 0.488,而 7B 局部性修复在源键留出下恢复槽位准确率与局部性。

 · 更新于 2026-09-25 · 约 20 分钟 · 9581 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 40 分钟 · 19562 字 阅读 →
论文解读

同一停靠点听见两种世界:ARFT 把超声与射频钉在同一坐标上

声源定位 | 6.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11176 字 阅读 →
论文解读

听错了才是听懂了?当大音频模型遇上人类幻听

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10268 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24532 字 阅读 →
论文解读

评测比模型更碎:用一套可组合的流水线让全模态分数可比、可复现

多模态模型 | 8.3/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10864 字 阅读 →
论文解读

当嵌入不再确定:把不确定性从打分一路带到校准的后端闭环

说话人验证 | 7.8/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11936 字 阅读 →
论文解读

越干净,越脆弱:当语音增强抹掉了阿尔茨海默病的线索

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11424 字 阅读 →
论文解读

会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒

音频理解 | 6.9/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12384 字 阅读 →
论文解读

只记得你说了什么,却忘了你怎么说的:长程副语言记忆的缺口

语音情感识别 | 7.1/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11195 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 69 分钟 · 34077 字 阅读 →
论文解读

会打断、会附和,还要听得懂分寸:把“何时说话”从“说什么”里拆出来

语音交互 | 7.3/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2608 字 阅读 →