不只收一个 WAV:把浏览器采集与变换留证的录音系统
VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。
VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。
论文用消声室实测脉冲响应验证成对心形传声器的声强测向,在 50 Hz 到 20 kHz 内比较 TF24 与 TF6 和 20mm 与 100mm 间距,最强证据是 20mm 的 TF24 在干扰信号比 -20 dB 和 -30 dB 时全频段中值跟踪误差在 2.5 度以内,代价是大间距高频和强干扰下误差明显增大且存在与波长相关的峰。
论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。
论文刻画单通道时频实增益掩蔽的正交投影上限,并用一个高斯混合后验均值估计器研究先验、读出与相位对称性:长窗留出设置下估计器距实测类上界 11.44 dB,校准分析中的约 70% 是分贝缺口之比,不是全部缺口或误差能量都由后验方差解释,更不是所有生成分离器的性能上限。
该规则验证基准收集 3456 个跨 109 语言的难译输入;在 911 个纯文本难例的盲测与 Gemma 4 验证下,人类参考译文通过率为 99.1%,Gemini 3.1 Pro 为 43.8%。人译高通过部分由收录条件保证;提供人工规则后的高分属于特权信息诊断,不代表模型自生成规则的能力。
针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。
该挑战用同一批十六类方言音频同时考辨别与转写,统一基线仅 53.62% 辨别准确率与 18.10% 转写错误率,最强受限系统做到 83.19% 与 11.08%,而困难方言与混淆方向显示两任务相关但不可互相替代。
论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。
论文把合成前 delivery 决策做成带源引用的结构化说话计划,用确定性校验器检查引用合法性与单线索局部性,在 32 种子 100 例 full100 对照中去掉源记录使引用必需分数下降 0.488,而 7B 局部性修复在源键留出下恢复槽位准确率与局部性。
共分析 30 篇语音/AI 论文
声源定位 | 6.4/10
音频理解 | 6.4/10
共分析 18 篇语音/AI 论文
多模态模型 | 8.3/10
说话人验证 | 7.8/10
音频分类 | 7.0/10
音频理解 | 6.9/10
语音情感识别 | 7.1/10
共分析 23 篇语音/AI 论文
语音交互 | 7.3/10