VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis

📄 先查账再唱歌:VoxReason 把语音的“怎么说”变成可引用的计划 英文题目:VoxReason: Listener-Free Evaluation of Source-Grounded Speech Planning Before Synthesis 一句话:针对表达性语音在合成前就已决定交付方式却无法问责的问题,VoxReason 把交付决策显式化为带源引用的说话计划并用确定性校验器加单线索反事实检验源依赖,在 1440 例受控源标签集上证明去源记录使引用约束分降 0.488 而局部性修复同时恢复准确率与局部性,代价是仅覆盖两种语句与单一场景且不评价波形质量。 标签:#语音合成 | #SFT | #基准测试 | #模型评估 | #可解释性 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Mengzhe Geng:National Research Council Canada 💬 毒舌点评 把合成前说话计划做成带引用校验的查账任务,切断了用好听波形掩盖无据决策的退路,证伪链条设计得相当清醒。但受控到只有两种语句和单一场景的验证,更像一份自我设限的诊断说明书,离通用语音规划基准还有明显距离。 📌 核心摘要 表达性语音在波形生成前已决定情感与韵律等交付方式,但现有音频评分无法判断该决策是否得到源记录许可。VoxReason提出源引用说话计划(source-cited speaking plan)作为合成前预测对象,以确定性校验器检查引用合法性、槽位一致与单线索反事实局部性。论文在1440例源标签受控集上证明去除源记录会大幅降低引用约束得分,而局部性修复后的学习规划器同时恢复槽位准确率与反事实一致性。在波形质量完全排除于当前主张之外后,该方法为对话与叙述类语音提供了先验账本。当前结论仍被窄语句、固定场景与确定性标签映射所限定。 🔗 开源与复现资源 代码:https://github.com/MENGZHEGENG/voxreason,提供衍生切分与评估代码 模型权重:论文中未提及 数据集:RAVDESS衍生source-label切分含1440条记录,通过GitHub仓库获取,不再分发原始音频 Demo:论文中未提及 复现材料:论文提供手稿源码,planner schema,verifier评估代码和重跑表格命令 论文中引用的开源项目:未提及 资源可达性验证:code=temporarily_unreachable 🧭 深度解读 同一句话,为何换个心情就该换个说法 想象你在做一个对话助手,用户只说了一句孩子在门口玩,文字本身没有情绪。可如果病例记录写着说话人刚经历丧失,你若用欢快的语调催促,就会显得冷漠,若用低沉缓慢的安慰,反而恰当。这种差别不在文字里,而在文字背后的许可记录里。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 754 words

语音/音乐/音频论文速递 2026-09-04

语音/音乐/音频论文速递 2026-09-04 共分析 30 篇论文 ⚡ 今日概览 ✅ 筛选入选 30 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音增强 5 篇 █████ #语音合成 3 篇 ███ #语音交互 2 篇 ██ #语音质量评估 2 篇 ██ #声源定位 1 篇 █ #语音情感识别 1 篇 █ #语音编码 1 篇 █ 📊 论文评分排行榜(30 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 ToolDF: Tool-Integrated Reasoning for Mixed… 8.4 前25% 方法研究 #音频伪造检测 🥈 Geometric Ceilings on Time-Frequency Masking for… 7.9 前25% 理论研究 #音乐源分离 🥉 CRAW: Codec Robust Audio Watermarking 7.7 前25% 方法研究 #音频水印 4. The 2026 PNPL Competition: Word Classification and… 7.5 前25% 数据集与基准 #语音识别 5. Test-time adaptation for speech enhancement with an… 7.5 前25% 方法研究 #语音增强 6. Alignment-Free Text-Audiobox for Voice Dubbing and… 7.5 前25% 系统技术报告 #语音合成 7. Listen to the Latents: Self-Correcting Speech… 7.2 前50% 方法研究 #语音识别 8. StreamWSR: Streamable and Lightweight Waveform-Domain… 7.2 前50% 方法研究 #语音增强 9. DuplexSpeechBench-IFEval: Evaluating Implicit… 7.2 前50% 数据集与基准 #语音交互 10. Building and Evaluating Fixed-Voice Thai TTS from… 7.2 前50% 系统技术报告 #语音合成 11. PACodec: A Low-bitrate Neural Speech Codec with… 7.1 前50% 方法研究 #语音编码 12. Decoupling Turn-Taking from Semantics: A Decoupled… 7.0 前50% 方法研究 #语音交互 13. Summary of the ChinaVoices Challenge 2026: Data, Tasks… 6.9 前50% 数据集与基准 #语音识别 14. The Attention Triangle in Audio-Video Models 6.9 前50% 方法研究 #音视频生成 15. Compressing Streaming Neural Audio Encoders via Latent… 6.9 前50% 方法研究 #语音识别 16. Dual-Form ASR: Semantics-Aware Inverse Text… 6.8 前50% 方法研究 #语音识别 17. Deep Neural Compression for RIR-Characterized Acoustic… 6.6 前50% 方法研究 #音频编码 18. SISER: Speaker-Invariant Speech Emotion Recognition… 6.5 前50% 方法研究 #语音情感识别 19. Masked Autoregressive Speech Enhancement with… 6.4 前50% 方法研究 #语音增强 20. Last Translation Benchmark 6.4 前50% 数据集与基准 #语音翻译 21. Neural Music Enhancement with Dual Time-Frequency… 6.2 前50% 方法研究 #语音增强 22. CAPQ-FAST: Content-Adaptive Perceived Quality… 6.2 前50% 应用研究 #音频质量评估 23. Beyond .WAV: Design and Software Verification of… 6.1 前50% 系统技术报告 #语音质量评估 24. Broadband Acoustic Intensity Direction Estimation with… 6.1 前50% 方法研究 #声源定位 25. Local Chord Corruption Is Not Recognizer Replay: Chord… 6.1 前50% 方法研究 #音乐生成 26. VoxReason: Listener-Free Evaluation of Source-Grounded… 5.9 前50% 数据集与基准 #语音合成 27. Is Semantics Enough for Speech Mean Opinion Score… 5.9 前50% 方法研究 #语音质量评估 28. Fairness Evaluation of Edge-AI Implementation for… 5.6 前50% 应用研究 #语音识别 29. StrixAE: An Intelligent Agent for Audio Enhancement… 5.5 前50% 系统技术报告 #语音增强 30. Opening mind by opening architecture: analysis… 4.5 后 50% 系统技术报告 #音频生成 📋 论文列表 🥇 真假混在一起时,只给整段打分为什么不够:ToolDF 的分诊式推理 英文题目:ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection ...

2026-09-04 · 更新于 2026-09-04 · 26 min · 5367 words

ARFT: A Synchronized Multimodal RF-Acoustic Dataset for Positioning in Distributed Environments

📄 同一停靠点听见两种世界:ARFT 把超声与射频钉在同一坐标上 英文题目:ARFT: A Synchronized Multimodal RF-Acoustic Dataset for Positioning in Distributed Environments 一句话:ARFT 针对室内分布式定位缺乏同步多模态真值数据的难题,用共架漫游车与逐周期编排把 91 路超声波形和 42 阵元射频快照绑定到同一位姿,并以 0.110 m 二维声学基线证明数据可用,代价是单房间静态采集且射频定位仍缺定量验证。 标签:#声源定位 | #端到端 | #数据集 | #基准测试 评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Daan Delabie:机构信息未在 arXiv HTML 中可靠披露 Jarne Van Mulders:机构信息未在 arXiv HTML 中可靠披露 Bert Pyck:机构信息未在 arXiv HTML 中可靠披露 Gustav Nilsson Gisleskog:机构信息未在 arXiv HTML 中可靠披露 Gilles Callebaut:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 三模态逐周期绑定加42阵元近满快照确实补上了室内分布式定位缺失的同步融合底座,声学最小二乘基线也让数据开箱可验。遗憾是射频端仍停留在指纹可视化而无定位精度,动态跟踪与跨房间泛化缺席让联合定位愿景只兑现了一半。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 908 words

Auditory Illusion Benchmark for Large Audio Language Models

📄 听错了才是听懂了?当大音频模型遇上人类幻听 英文题目:Auditory Illusion Benchmark for Large Audio Language Models 一句话:论文把十种听觉错觉做成可对照人类听感的选择题来考大音频模型,发现最像人的模型也只有人类一半的易感度,而像人与忠于物理信号之间至今没有模型能兼得,代价是提示词稍改结果就大变。 标签:#音频理解 | #多模态模型 | #基准测试 | #模型评估 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Hayoon Kim:机构信息未在 arXiv HTML 中可靠披露 Eunice Hong:机构信息未在 arXiv HTML 中可靠披露 Kyogu Lee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把听觉错觉从演示视频变成可跑分、可对照人类分布的基准,这个选题确实抓住了音频评测的盲区。问题是人类基线只靠20名绝对音感听者撑场面,控制准确率又普遍在随机线附近晃悠,所谓最像人的模型更像蒙对了选项而非真听错了。 📌 核心摘要 人类听觉会系统性偏离物理信号,而现有大型音频语言模型评测多围绕转录、分类、检索等客观真值任务,缺乏对主观错觉的系统检验。本文提出首个听觉错觉基准 Auditory Illusion Benchmark,覆盖音乐、声音、语音三大内容域的10种代表性错觉,并按主导机制划分为物理型与物理加知识型,同时配套错觉刺激与匹配控制刺激和人类听觉实验。方法核心是将每种错觉转化为二选一或三选一感知判断题,以人类多数投票定义错觉标签,并用人类相似准确率、现实符合率与错觉易感指数刻画模型位置。与已有视觉错觉基准相比,新意在于面向音频的参数化生成管线与人类同题对照协议,以及对自下而上声学与自上而下先验的分离讨论。关键结果是最佳模型平均错觉易感指数仅约0.455,远低于人类参照的1.0,且高易感常伴随低于随机水平的控制准确率,提示偏差多于感知;知识驱动错觉上多个模型由信号忠实反转为类人易感,提示对齐可能来自语言先验而非共享低层听觉处理。实际意义是为认知对齐提供独立于识别精度的诊断维度,可用于区分字面检测器与类人感知者,并明确高易感在交互场景与安全精密场景下的不同可取性。主要局限是人类样本特殊、合成刺激与自然经验有差距、指令措辞可带来超过模型间差异的波动,外推到一般听众与真实场景时需谨慎。 🔗 开源与复现资源 代码:https://github.com/gillosae/aib 模型权重:论文中未提及 数据集:AIB基准数据集,包含10种听觉错觉,共10385个错觉刺激和4444个对照刺激,总计14829个样本,另有包含1032个错觉刺激和534个对照刺激的mini子集,总计1566个样本,获取链接为 https://github.com/gillosae/aib Demo:论文中未提及 复现材料:论文提及提供用于系统生成基准错觉的开源实现以及通过受控听觉实验构建的人类基线数据,获取方式为访问 https://github.com/gillosae/aib,论文证据中未提及训练配置与检查点细节 论文中引用的开源项目:评估中提及 Pengi、Voxtral-Mini、MuLLaMa、Kimi-Audio-Instruct、Audio Flamingo 3、Fun-Audio-Chat、Qwen-Audio-Chat、Qwen2-Audio-Instruct、GLM-4-Voice、Gemini 3.1 Pro,论文证据中未给出上述项目的HTTPS链接 资源可达性验证:code=temporarily_unreachable;dataset=temporarily_unreachable;reproduction=temporarily_unreachable 🧭 深度解读 耳朵为什么总在骗大脑? 想象你在琴房里听老师弹了一个低音,你发誓听到了那个浑厚的根音,可频谱仪却告诉你那个频率根本没有发出。这不是你走神,而是听觉系统在主动补全。人类听声音从来不是麦克风式的忠实录音,大脑会用谐波关系、掩蔽记忆、节奏预期和语言知识去猜测世界,这种猜测大多数时候高效,偶尔就会系统性跑偏,形成听觉错觉。 ...

2026-09-03 · 更新于 2026-09-04 · 3 min · 550 words

语音/音乐/音频论文速递 2026-09-03

语音/音乐/音频论文速递 2026-09-03 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音合成 2 篇 ██ #音频分类 2 篇 ██ #声源定位 1 篇 █ #语音增强 1 篇 █ #语音情感识别 1 篇 █ #音乐生成 1 篇 █ #音视频理解 1 篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVERT: Audio-Verified Adjudication for Spoken Dialogue… 7.6 前25% 方法研究 #语音识别 🥈 Hearing the Whispers: Black-Box Membership Inference… 7.5 前25% 方法研究 #语音合成 🥉 The Missing Temporal Link: Temporal Context Routing… 7.5 前25% 方法研究 #音视频生成 4. VibeVoice-ASR-Streaming Technical Report 7.5 前25% 系统技术报告 #语音识别 5. A Common Measure of Communication for Speech Brain… 7.4 前50% 方法研究 #语音识别 6. SonicCaps: Large-Scale Diverse and Fine-Grained… 7.2 前50% 数据集与基准 #音频检索 7. Understanding Automatic Mixing: A Subtask-Oriented… 7.0 前50% 应用研究 #音乐生成 8. Scalable Direction-Following TTS via Voice Impression… 6.8 前50% 方法研究 #语音合成 9. Efficient Passive Acoustic Monitoring of Killer Whales… 6.7 前50% 应用研究 #音频分类 10. Auditory Illusion Benchmark for Large Audio Language… 6.4 前50% 数据集与基准 #音频理解 11. ARFT: A Synchronized Multimodal RF-Acoustic Dataset… 6.4 前50% 数据集与基准 #声源定位 12. Sensing Bone-Conducted Speech with Earbuds 6.3 前50% 应用研究 #语音增强 13. PhoenixNest-Video: Evidence-Grounded Multimodal Agent… 6.3 前50% 方法研究 #音视频理解 14. SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper… 6.1 前50% 应用研究 #语音识别 15. Removing Speech, Keeping Activities: A Privacy… 5.9 前50% 应用研究 #音频分类 16. Choosing a PEFT Variant for Per-Patient Dysarthric ASR… 5.9 前50% 应用研究 #语音识别 17. VAANI Noise Event Dataset: A curated spontaneous… 5.8 前50% 数据集与基准 #语音识别 18. Predictors of Loneliness in Older Adults Using… 4.9 后 50% 应用研究 #语音情感识别 📋 论文列表 🥇 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking ...

2026-09-03 · 更新于 2026-09-04 · 15 min · 3026 words

A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation

📄 评测比模型更碎:用一套可组合的流水线让全模态分数可比、可复现 英文题目:A Composable Evaluation System for Reproducible Omni-Modal Foundation Model Evaluation 一句话:面对文本、图像、视频、音频四模态评测工具链互不兼容导致的分数不可比与复现难,OmniEvaluator 以统一中间模式将推理与评测解耦为可组合流水线,并以产物钉扎与轻量 CPU 验证器在跨引擎与跨提示下把分数波动从数十点压到数点,代价是验证器仅判文本语义且落后最强闭源裁判约 5 点。 标签:#多模态模型 | #模型评估 | #基准测试 评分:8.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Hodong Lee:NAVER Cloud AI;Korea University Sanghee Park:NAVER Cloud AI;KAIST AI Dohoon Ryu:NAVER Cloud AI Jungwhan Kim:NAVER Cloud AI Junyeob Kim:Seoul National University Soyoon Kim:NAVER Cloud AI Geewook Kim:NAVER Cloud AI;KAIST AI 💬 毒舌点评 用统一中间模式把 4 类推理后端与 4 个评测框架打通,将 N×M pairwise 集成降至 N+M,并用产物钉扎与轻量 CPU 验证器解决分数不可比与复现难的工程痛点,思路务实且已在 HyperCLOVA X 8B Omni 研发中落地。代价是贡献偏系统整合而非建模突破,验证器仅做文本三元组二分类、准确率 85.0 仍落后最强闭源裁判约 5 个点,对视觉 grounding、音频质量与多模态生成等非文本维度无能为力。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1426 words

A Unified Uncertainty-Aware Back-End for Speaker Verification: Scoring, Normalization, and Calibration

📄 当嵌入不再确定:把不确定性从打分一路带到校准的后端闭环 英文题目:A Unified Uncertainty-Aware Back-End for Speaker Verification: Scoring, Normalization, and Calibration 一句话:针对试次可靠性随长度与信道而变的说话人验证,论文用同一对角协方差贯穿余弦打分、队列归一化与逻辑回归校准,在 VoxCeleb 双骨干上将平均相对提升推至约 28 % 与 27 %,代价是增益高度依赖不确定性估计质量且部分 minDCF 出现回退。 标签:#说话人验证 | #对比学习 | #鲁棒性 | #模型融合 | #基准测试 评分:7.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Junjie Li:机构信息未在 arXiv HTML 中可靠披露 Kong Aik Lee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把协方差从打分一路用到归一化和校准,补上了以往不确定性只停留在前端的断层,工程闭环做得完整且在双骨干上均有提升。短板是三段式增益拆开看每个增量都很小且部分 minDCF 反而变差,过度依赖 U^3-xi 这一特定不确定性估计器,对不确定性质量本身缺乏鲁棒性分析。 ...

2026-09-02 · 更新于 2026-09-04 · 5 min · 1064 words

Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer's Disease Detection

📄 越干净,越脆弱:当语音增强抹掉了阿尔茨海默病的线索 英文题目:Cleaner Speech, Weaker Generalization: Revisiting Pitt-Derived Benchmarks for Alzheimer’s Disease Detection 一句话:论文以 Pitt 语料家族为对照场,证明去噪与策展虽能抬高同域分数,却因分布偏移削弱跨域鲁棒性,即使训练与测试同增强或引入大音频语言模型也难以挽回。 标签:#音频分类 | #自监督学习 | #基准测试 | #鲁棒性 评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Luqi Sun:Center for Language and Speech Processing (CLSP), Johns Hopkins University Shreeram Suresh Chandra:机构信息未在 arXiv HTML 中可靠披露 Lin Zhang:机构信息未在 arXiv HTML 中可靠披露 You-Jin Li:Research Center for Information Technology Innovation, Academia Sinica Brian MacWhinney:University of Michigan, Ann Arbor Yu Tsao:Research Center for Information Technology Innovation, Academia Sinica Emily Mower Provost:Carnegie Mellon University Berrak Sisman:Center for Language and Speech Processing (CLSP), Johns Hopkins University 💬 毒舌点评 贡献在于把 Pitt 家族“越干净越好”的集体无意识拽到台前,用同域/跨域与匹配/失配增强的四重对照证明去噪带来的分布偏移代价,对长期把 ADReSS 当即插即用基准的社区是一记必要的警钟。缺陷也同样直白:全部跨域结论压在仅 56 例的 English Lu Corpus 这一根独苗上,原始 Pitt/Pitt/ADReSS/ADReSSo 的增强管线均未公开却用 5 种现代增强器做代理归因,对“干净为何更差”仅靠 DNSMOS 的 BAK 抬升与单例 Mel 谱图定性描述,未能量化停顿、迟疑、词汇贫乏等病理标志究竟被何种伪影抹平。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1407 words

TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models

📄 会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒 英文题目:TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models 一句话:TAG-Bench 把时序音频定位从 30 秒单区间拉到 20 分钟一对多枚举,用 1750 条人工校验问答与并集 IoU/计数/格式三层度量揭示即使最强的 FireRedAudio 也仅 31.2 mIoU 且所有模型计数准确率不过 13.2% 的系统性短板。 标签:#音频理解 | #音频大模型 | #音频事件检测 | #基准测试 | #长音频处理 评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuhang Dai:机构信息未在 arXiv HTML 中可靠披露 Xin Shu:机构信息未在 arXiv HTML 中可靠披露 Zengxi Li:机构信息未在 arXiv HTML 中可靠披露 Lei Xie:机构信息未在 arXiv HTML 中可靠披露 Xiangang Li:机构信息未在 arXiv HTML 中可靠披露 Jianwei Yu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音频时序定位从 30 秒短片段与单区间检测拉到 20 分钟长音频与一对多枚举的真实痛点,并用 21 个系统的统一自由文本评测撕开了当前大音频语言模型连时间都说不清的遮羞布;短板是所有结论都建立在规则解析的混合度量上,数据与评测代码承诺尚未兑现,且 1750 条查询在 8 个子集上的诊断粒度与统计效力仍显单薄。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1668 words

VoiceLongMemEval: Do Assistants Remember How You Sounded?

📄 只记得你说了什么,却忘了你怎么说的:长程副语言记忆的缺口 英文题目:VoiceLongMemEval: Do Assistants Remember How You Sounded? 一句话:VoiceLongMemEval 把“怎么说”埋进约 10 万 token 的多会话历史,用三级对抗门控逼答案只能从副语言恢复,证明 8 个模型在描述条件下均显著超越盲文本、而 Whisper 级联会系统性丢掉递送信号,代价是全合成数据与仅 oracle 区间的有限外推。 标签:#语音情感识别 | #大语言模型 | #音频理解 | #基准测试 评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Ramit Pahwa:机构信息未在 arXiv HTML 中可靠披露 Parivesh Priye:机构信息未在 arXiv HTML 中可靠披露 Apoorva Beedu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 首次把副语言记忆从单句感知拉长到约 100k tokens 的多会话记忆,设计三级对抗门控确保答案不可从文本推断,概念干净且切中级联式语音助手的结构性缺陷;短板是 523 题全部为大语言模型合成与 Dia 1.6B 合成语音,仅 202 题核心集过盲对抗门控,衍生 321 题未单独门控,音频验证仅限 2 个 7B 模型且为 evidence-only 的 Oracle 评测,生态说服力与自然度仍有距离。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1422 words