Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue

📄 何时闭嘴何时开口分开学:用真实重叠教会状态机的全双工配方 英文题目:Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue 一句话:针对合成带学不会真实打断与重叠时序的问题,该工作用人人语音学轮次、用可配人机文本保语义并以事件规则与来源感知损失缝合,在受控词量下轮次 F1 提升约 0.31、放量后语义距基座仅差 0.09,代价是单带仍压缩连续时间与副语言。 标签:#语音交互 | #大语言模型 | #流式处理 | #基准测试 评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yihang Li:Kyoto University Chenhui Chu:Kyoto University 💬 毒舌点评 把轮次控制与语义解耦、用真实人人对话学打断的思路切中了神经有限状态机合成数据的要害,事件引导的规则序列化做得扎实可扩展。但合成基线复现自由度偏大且语义评估口径不对等,暂停处理的激进策略也暴露了单带序列化压缩连续时间的固有代价。 📌 核心摘要 全双工对话需要同时处理打断、反向通道和地板争夺,而神经有限状态机将状态转换与回复生成序列化到单条因果带上,却依赖大语言模型合成难以还原真实声学时序的训练带。本文提出解耦数据方法,用真实人人口语对话学习轮次控制,用可配置的人机文本对话塑造语义,并以全规则的事件引导变换加来源感知校准损失实现联合训练。在控制训练token量的对比中,该方法在轮次F1与VoiceBench上均大幅超越合成基线,扩大到按比例上采样混合后语义基本恢复至基座模型零样本水平。实际意义在于为基于有限状态机的全双工系统提供了可扩展到任意人人语料且无需大语言模型标注的配方。主要边界是单带离散化必然损失连续时间与副语言信息,且当前仅覆盖双人问答场景。 🔗 开源与复现资源 代码: 仓库链接为 https://github.com/Liyht/def-fsm 模型权重: 论文中说明模型与代码均在 https://github.com/Liyht/def-fsm 获取,未提及独立HuggingFace或ModelScope权重链接 数据集: 采用Switchboard语料和Fisher语料作为人人口语对话,未提及获取链接,采用ShareGPT52K数据集作为人机对话,链接为 https://huggingface.co/datasets/RyokoAI/ShareGPT52K,另用GPT-4-Turbo生成1500个合成对话作为基线,未提及公开链接 Demo: 论文中未提及 复现材料: 基础模型为Qwen3-4B,人人与人机按1比1 token量混合,Fisher与Switchboard按4比1混合,来源感知校准损失设置tau为1且alpha为0.6,上下文长度为1024 token,峰值学习率为1.0e-5且warmup比例为0.03,token匹配设置训练至多300步,放量混合设置训练至多700步,细节见Appendix B.1和Appendix D 论文中引用的开源项目: Faster-Whisper,链接为 https://github.com/SYSTRAN/faster-whisper,Kokoro TTS,链接为 https://github.com/hexgrad/kokoro,另提及Whisper-Turbo和SimulStreaming和Silero VAD和Qwen3-32B,未提及对应链接 资源可达性验证:code=temporarily_unreachable;model=temporarily_unreachable;dataset=temporarily_unreachable;third_party=temporarily_unreachable;third_party=temporarily_unreachable 🧭 深度解读 人为什么能边听边想边插话? 想象你和朋友争论金星和火星哪个更大,你刚说到一半,对方轻轻嗯了一声,你自然继续讲下去。可当对方突然提高声音纠正你,你会立刻停下让对方说完。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 879 words

Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints

📄 压住房间的尾音:375bps 里留住混响的衰减骨架 英文题目:Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints 一句话:针对通用神经编码器压缩房间脉冲响应时丢失衰减结构的问题,该工作在 EnCodec 单码本框架上加入能量衰减与混响语音两级约束,在 375bps 下把 T60 误差降到 1.14 秒、ViSQOL 做到 4.11,代价是仅在单房间验证且无开源。 标签:#音频编码 | #对抗训练 | #空间音频 | #模型压缩 评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Chen-Yuan Ning:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露 Xiao-Hang Jiang:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把房间脉冲响应当成特殊音频来压的思路切中了通用神经编解码器水土不服的痛点,能量衰减曲线与混响语音联合约束的设计颇为对症。遗憾在于验证只困在单一房间的 Motus 数据上,基线又弱又少,低码率极限的反常波动也缺乏解释,离顶会要求的普适性证据还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 967 words

Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition

📄 该归一的漏掉,不该归一的乱改:双形式识别如何管住数字 英文题目:Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition 一句话:中文语音识别同时要忠实记录怎么说、又要得体呈现怎么写,论文用提示词切换的口语与书面配对监督加数字敏感的序列优化,在必需归一上做到 4.64% I-CER 与 94.85% 关键词 F1、在禁用保留上做到 95.18% 保留率,代价是训练数字覆盖仅 4.4% 且评测局限于离线小规模人工集。 标签:#语音识别 | #语音大模型 | #大语言模型 | #基准测试 评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fengrun Zhang:机构信息未在 arXiv HTML 中可靠披露 Li Fu:机构信息未在 arXiv HTML 中可靠披露 Wangjin Zhou:机构信息未在 arXiv HTML 中可靠披露 Lu Fan:机构信息未在 arXiv HTML 中可靠披露 Youzheng Wu:机构信息未在 arXiv HTML 中可靠披露 Xiaodong He:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把中文逆文本归一化从级联后处理收编为提示词可控的双形式联合建模,并用 Require-ITN 与 Forbid-ITN 把该归一和不该归一拆开考核,是切中部署痛点的设计。短板是书面目标中含阿拉伯数字的时长仅占4.4%,评测只靠772条与309条的单一SpeechIO衍生集,序列级奖励相对验证后监督的增益有限却包装成核心方法贡献。 ...

2026-09-04 · 更新于 2026-09-04 · 2 min · 296 words

DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

📄 说了像本人,不等于接得住话:角色暗示里的时机考验 英文题目:DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents 一句话:论文用同一段用户语音对比显式规则与人设暗示下的接话时机,发现全双工模型推断代价最高达 9.7 个百分点,而内容像角色的模型仍做不出打断与附和,且安全冲突下仅一例过半守住安全侧。 标签:#语音交互 | #语音大模型 | #基准测试 | #实时处理 | #模型评估 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Puneet Mathur:University of Maryland College Park, USA Dinesh Manocha:Project Page: 💬 毒舌点评 把显式打断规则换成悲伤辅导员与911接线员的人设暗示来考全双工话轮控制,这个切口抓得准且泄漏控制做了实事。遗憾在于6个系统绝对指令遵从率普遍低于50%,近零差距模型的细排名在阈值抖动下并不稳,安全层级结论更多是30例小样本警示而非定论。 📌 核心摘要 全双工语音智能体需要根据角色推断何时倾听、附和、打断、让出或保持话轮,现有评测多只给显式话轮指令。论文提出DuplexSpeechBench-IFEval(DSB-IFEval,隐式指令遵循评测),用同一用户音频搭配5种条件协议对比显式执行与人设暗示执行。方法上以8个行为对比角色、6类会话探针、程序化合成与双通道实时编排为流水线,以确定性指令遵从分数Instruction Adherence Score(IAS,指令遵从分数)与大语言模型评价的人设内容分数Persona Adherence Score(PAS,人设遵从分数)解耦内容与时机。6系统实验显示全双工架构的蕴含差距Entailment Gap(蕴含差距)达9.7个百分点,而回合制系统内容跟随强但打断与附和几乎为0。安全冲突下仅MiniCPM-o-4.5在语义层60.0%选择安全侧,且IAS非零者仅2个系统。该基准为角色化实时语音部署提供了可复现的层级检验,但局限在英语双轮合成语音与小规模安全集。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 790 words

Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR

📄 平均分好看,重度患者却依然听不懂:在 Jetson 上重算唇腭裂语音的公平账 英文题目:Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR 一句话:针对通用模型在唇腭裂不同严重度上系统性失效且云端不可靠的问题,论文用固定 280 条预算的严重度组合微调 Whisper-small 并在 Jetson 上做 FP16 端侧实测,以 NOMIMOSE 把汇总 WER 从 62.46% 降到 22.72% 且 RTF 保持 0.167 为证据,代价是重度组仍高达 54.96% 且仅在单一儿童语料上验证。 标签:#语音识别 | #迁移学习 | #低资源 评分:5.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Susmita Bhattacharjee:Indian Institute of Technology Guwahati, India Himashri Deka:Indian Institute of Technology Guwahati, India H.S. Shekhawat:Indian Institute of Technology Guwahati, India S.R.M. Prasanna:Indian Institute of Technology Dharwad, India 💬 毒舌点评 把严重度公平性与 Jetson 端侧实测放进同一闭环,直面了病理语音最痛的分布不均,选题切口准。短板是仅靠 280 条训练的单一儿童语料自证,重度词错误率仍在 55% 上下却被包装成均衡胜利,边缘侧也只是现成 Whisper 的半精度搬运。 ...

2026-09-04 · 更新于 2026-09-04 · 6 min · 1115 words

Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation

📄 掩蔽走不到的地方:一条直线、一个夹角与均方误差的回拉 英文题目:Geometric Ceilings on Time-Frequency Masking for Single-Channel Separation 一句话:单通道时频掩蔽的实增益格式把估计锁死在混合方向的直线上,论文用投影几何算出精确上限与四层算子类,再以非循环高斯混合后验证明均方准则会把估计拉回直线并在 MUSDB18 上测得 11.44 dB 量级的稳定缺口。 标签:#音乐源分离 | #生成模型 | #理论分析 | #基准测试 评分:7.9/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Maxime Baelde:organization=Independent researcher, city=Lille, country=France 💬 毒舌点评 亮点在于把时频掩蔽上限写成投影几何并证明均方准则把后验均值拉回实数线,理论链条完整且可证伪。短板是所测高斯混合先验远弱于当代分离器,整篇更像用弱模型验证强定理而非逼近上限本身。 📌 核心摘要 单通道时频掩蔽长期以理想比值掩蔽等特解作为上限,无法回答实增益格式本身禁止什么。本文把单频点估计看作复平面上的实线性算子,证明最优实增益是源向量向混合线上的正交投影,残差完全由源与混合夹角决定。作者建立实掩蔽、复掩蔽、宽线性与跨频耦合四层嵌套算子类,并对应先验零均值、循环对称与频率独立三条假设。构造堆叠实虚谱上的非循环高斯混合先验,其后验均值形式上离开最小类,但证明相位后验关于混合方向对称时均值落回实线,超额误差等于 oracle 增益的后验方差。在 MUSDB18 上人声与伴奏分离实验中,拟合估计器始终大幅低于逐帧上限,且增加分量数、训练量与全协方差均未弥合差距,约七成缺口可归因于后验方差。意义在于把突破上限的希望从更宽滤波器转向帧自适应先验与非均方准则。局限是测量取自较弱的浅层生成模型,且上限经重合成传输存在数值松弛。 🔗 开源与复现资源 代码:https://github.com/mbaelde/masking-ceiling,tag v1.0.0,separator 实现导入自 https://github.com/mbaelde/generative-audio-source-models 模型权重:论文中未提及 数据集:论文中未提及 Demo:论文中未提及 复现材料:论文说明全部 figure 和 table 可由 tag v1.0.0 复现,训练配置采用 diagonal 协方差并设置 floor 为 10-6,EM 迭代为 30 次,每种配置按 K 取 8,16,32 独立拟合且使用固定 seed,训练量按每源 20000 和 150000 frames 设置两档,堆叠维度在 L 为 1024 时是 1026,在 L 为 256 时是 258 论文中引用的开源项目:masking-ceiling https://github.com/mbaelde/masking-ceiling,generative-audio-source-models https://github.com/mbaelde/generative-audio-source-models 资源可达性验证:code=temporarily_unreachable;code=temporarily_unreachable;third_party=temporarily_unreachable;third_party=temporarily_unreachable 🧭 深度解读 单通道分离为何总在时频图上做乘法 想象你只拿到一轨混音,要从中捞出人声。最省事的办法是在短时傅里叶变换后的每个小格子上乘一个实数,把混合的幅度压一压、抬一抬,相位则原样保留。这就是理想比值掩蔽、维纳滤波和无数神经网络掩蔽器的共同格式,简单、稳定、易训练。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 915 words

Is Semantics Enough for Speech Mean Opinion Score Prediction?

📄 语义听得懂内容,声学才听得出破绽:MOS 预测的双耳之争 英文题目:Is Semantics Enough for Speech Mean Opinion Score Prediction? 一句话:论文把语义自监督、纯声学编解码与语义声学统一编解码放在同一冻结与微调探针下比较,证明匹配语言下协同表征上界更高而跨语言时连续语义更稳,代价是公平性与机理证据仍不完整。 标签:#语音质量评估 | #自监督学习 | #语音合成 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Tianyu Lan:机构信息未在 arXiv HTML 中可靠披露 Yufei Shi:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Honghao Sun:机构信息未在 arXiv HTML 中可靠披露 Huipeng Du:机构信息未在 arXiv HTML 中可靠披露 Zhenhua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把语义主导的自监督学习与声学重建的神经音频编解码器放在同一冻结探针下硬碰硬,问题切得准。短板在于所谓统一表征几乎全是借用现成 XCodec 与 SpeechTokenizer 的封装对比,缺少对语义声学解耦的因果验证,跨语言反转也解释得过于仓促。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 870 words

Last Translation Benchmark

📄 不再打总分:给每道翻译难题配一把专用量尺 英文题目:Last Translation Benchmark 一句话:面对饱和的机器翻译基准与失灵的整体打分,这项工作用众包难例加逐题验证规则把评价变成可复现的通过率,最强模型仅约四成通过而人工接近满分,代价是样本偏向刻意难题与英文中心。 标签:#语音翻译 | #大语言模型 | #多语言 | #基准测试 | #多模态模型 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Vilém Zouhar:机构信息未在 arXiv HTML 中可靠披露 Niyati Bafna:机构信息未在 arXiv HTML 中可靠披露 Mukund Choudhary:机构信息未在 arXiv HTML 中可靠披露 Maike Züfle:机构信息未在 arXiv HTML 中可靠披露 Sara Rajaee:机构信息未在 arXiv HTML 中可靠披露 Pinzhen Chen:机构信息未在 arXiv HTML 中可靠披露 Jannis Vamvas:机构信息未在 arXiv HTML 中可靠披露 Sara Papi:机构信息未在 arXiv HTML 中可靠披露 Ona de Gibert:机构信息未在 arXiv HTML 中可靠披露 Bhavitvya Malik:机构信息未在 arXiv HTML 中可靠披露 Eliya Habba:机构信息未在 arXiv HTML 中可靠披露 Orfeas Menis Mastromichalakis:机构信息未在 arXiv HTML 中可靠披露 Patrícia Schmidtová:机构信息未在 arXiv HTML 中可靠披露 Michelle Wastl:机构信息未在 arXiv HTML 中可靠披露 Sheriff Issaka:机构信息未在 arXiv HTML 中可靠披露 Leshem Choshen:机构信息未在 arXiv HTML 中可靠披露 Stella Biderman:机构信息未在 arXiv HTML 中可靠披露 Antonis Anastasopoulos:机构信息未在 arXiv HTML 中可靠披露 Jan Niehues:机构信息未在 arXiv HTML 中可靠披露 Rico Sennrich:机构信息未在 arXiv HTML 中可靠披露 Mrinmaya Sachan:机构信息未在 arXiv HTML 中可靠披露 Ondřej Bojar:机构信息未在 arXiv HTML 中可靠披露 Kenton Murray:机构信息未在 arXiv HTML 中可靠披露 Jörg Tiedemann:机构信息未在 arXiv HTML 中可靠披露 Alham Fikri Aji:机构信息未在 arXiv HTML 中可靠披露 Philipp Koehn:机构信息未在 arXiv HTML 中可靠披露 Christof Monz:机构信息未在 arXiv HTML 中可靠披露 Alexandra Birch:机构信息未在 arXiv HTML 中可靠披露 Sowmya Vajjala:机构信息未在 arXiv HTML 中可靠披露 Chalamalasetti Kranti:机构信息未在 arXiv HTML 中可靠披露 Cristina España-Bonet:机构信息未在 arXiv HTML 中可靠披露 Nobin Sarwar:机构信息未在 arXiv HTML 中可靠披露 David Kaczér:机构信息未在 arXiv HTML 中可靠披露 Shunta Asano:机构信息未在 arXiv HTML 中可靠披露 Malik Marmonier:机构信息未在 arXiv HTML 中可靠披露 Daban Q. Jaff:机构信息未在 arXiv HTML 中可靠披露 Vaisakhi Mishra:机构信息未在 arXiv HTML 中可靠披露 Hend Al- Khalifa:机构信息未在 arXiv HTML 中可靠披露 Gabriele Sarti:机构信息未在 arXiv HTML 中可靠披露 Sourajit Saha:机构信息未在 arXiv HTML 中可靠披露 Nils Rehlinger:机构信息未在 arXiv HTML 中可靠披露 Juan Daniel Cuervo Villa:机构信息未在 arXiv HTML 中可靠披露 Jonathan Tonglet:机构信息未在 arXiv HTML 中可靠披露 Saugata Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Dominik Macháček:机构信息未在 arXiv HTML 中可靠披露 Jagannathan Ramanujam:机构信息未在 arXiv HTML 中可靠披露 Heejin Do:机构信息未在 arXiv HTML 中可靠披露 Zuzana Nadova:机构信息未在 arXiv HTML 中可靠披露 Fred Philippy:机构信息未在 arXiv HTML 中可靠披露 Fabian Retkowski:机构信息未在 arXiv HTML 中可靠披露 Maria Lymperaiou:机构信息未在 arXiv HTML 中可靠披露 Silvia Casola:机构信息未在 arXiv HTML 中可靠披露 Hanna Yukhymenko:机构信息未在 arXiv HTML 中可靠披露 Shubhashis Roy Dipta:机构信息未在 arXiv HTML 中可靠披露 Sangwon Ryu:机构信息未在 arXiv HTML 中可靠披露 Andrés Jerez:机构信息未在 arXiv HTML 中可靠披露 Ron Keinan:机构信息未在 arXiv HTML 中可靠披露 Shuaib Shuaib Yusuf:机构信息未在 arXiv HTML 中可靠披露 Avantica Vempati:机构信息未在 arXiv HTML 中可靠披露 Maria Carmen Staiano:机构信息未在 arXiv HTML 中可靠披露 Sukannya Purkayastha:机构信息未在 arXiv HTML 中可靠披露 Adrian Cosma:机构信息未在 arXiv HTML 中可靠披露 Vitalii Babenko:机构信息未在 arXiv HTML 中可靠披露 Erivan Inan:机构信息未在 arXiv HTML 中可靠披露 Aviral Nigam:机构信息未在 arXiv HTML 中可靠披露 Wafa Aissa:机构信息未在 arXiv HTML 中可靠披露 Fatima Haouari:机构信息未在 arXiv HTML 中可靠披露 Venkata Prasanth Kumar Gummadi:机构信息未在 arXiv HTML 中可靠披露 Mehdi Jafarzadeh:机构信息未在 arXiv HTML 中可靠披露 Valentin Scourneau:机构信息未在 arXiv HTML 中可靠披露 Lukas Edman:机构信息未在 arXiv HTML 中可靠披露 Kaiser Sun:机构信息未在 arXiv HTML 中可靠披露 Shaomu Tan:机构信息未在 arXiv HTML 中可靠披露 Mohammad Sadegh Gholizadeh:机构信息未在 arXiv HTML 中可靠披露 Johannes-Rudolf David:机构信息未在 arXiv HTML 中可靠披露 Dipankar Srirag:机构信息未在 arXiv HTML 中可靠披露 Javier García Gilabert:机构信息未在 arXiv HTML 中可靠披露 Ruta Binkyte:机构信息未在 arXiv HTML 中可靠披露 Manar Ali:机构信息未在 arXiv HTML 中可靠披露 Ana-Maria Bucur:机构信息未在 arXiv HTML 中可靠披露 Sabry E. Farrag:机构信息未在 arXiv HTML 中可靠披露 Youssef Saber:机构信息未在 arXiv HTML 中可靠披露 Yihong Liu:机构信息未在 arXiv HTML 中可靠披露 Jean Maillard:机构信息未在 arXiv HTML 中可靠披露 Cojocaru Nicoleta:机构信息未在 arXiv HTML 中可靠披露 Xiaochuang Yuan:机构信息未在 arXiv HTML 中可靠披露 Sina Ahmadi:机构信息未在 arXiv HTML 中可靠披露 Philipp Mondorf:机构信息未在 arXiv HTML 中可靠披露 Kaustubh Dhole:机构信息未在 arXiv HTML 中可靠披露 Roman Wixinger:机构信息未在 arXiv HTML 中可靠披露 Shenbin Qian:机构信息未在 arXiv HTML 中可靠披露 Manuel Tuor:机构信息未在 arXiv HTML 中可靠披露 Sergey Troshin:机构信息未在 arXiv HTML 中可靠披露 Jonathan Yahav:机构信息未在 arXiv HTML 中可靠披露 Fida Mohammad Thoker:机构信息未在 arXiv HTML 中可靠披露 Amir Arsalan Rezapour:机构信息未在 arXiv HTML 中可靠披露 Lance Calvin Lim Gamboa:机构信息未在 arXiv HTML 中可靠披露 Manon Reusens:机构信息未在 arXiv HTML 中可靠披露 Kätriin Kukk:机构信息未在 arXiv HTML 中可靠披露 Koel Dutta Chowdhury:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把评价从整体印象分改为单样本可判定验证规则,用信息不对称缓解大语言模型(Large Language Model,LLM)既当选手又当裁判的自利偏差,思路干净且可诊断。短板是众包难例天然偏向猎奇、对抗与英文中心分布,对日常翻译质量代表性不足,规则质量与跨语言可比性仍高度依赖人工复核,迁移主张偏强。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1031 words

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

📄 暖启动之后,基座模型还记得什么:用隐状态几何找回被遗忘的人名 英文题目:Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions 一句话:针对暖启动语音大模型对命名实体等多词元词的系统性误识,论文用语音模型与自身基座模型的层间角度与幅度几何做门控,只在约 10% 高语义依赖位置做束搜索与概率插值,以约 1.4 倍贪心代价恢复束搜索 96.4% 命名实体增益并在两遍纠错中把平均命名实体错误率从 18.29% 降到 17.69% 且总体词错误率不恶化。 标签:#语音识别 | #多模态模型 | #参数高效微调 | #鲁棒性 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Chan-Jan Hsu:机构信息未在 arXiv HTML 中可靠披露 Jaeyeon Kim:机构信息未在 arXiv HTML 中可靠披露 Chao-Han Huck Yang:NVIDIA Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露 Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露 Carlos Busso:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把适配后残留的基座大语言模型变成免费校正器,用跨模型隐状态几何做门控,避免全局融合的幻觉灾难,想法干净。短板是所谓自校正高度依赖在 YODAS 上拟合的高斯门限与延续词元规则,换模型换领域就要重标定,完整端到端只验了一个 Phi-4-Multimodal,离通用解码器还差一口气。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 937 words

Local Chord Corruption Is Not Recognizer Replay: Chord-Condition Propagation in MIDI-SAG

📄 集中一击不等于真实部署:局部和弦损坏为何夸大了伴奏生成器的反应 英文题目:Local Chord Corruption Is Not Recognizer Replay: Chord-Condition Propagation in MIDI-SAG 一句话:论文把中央四秒三全音损坏与完整识别器回放放在同一冻结渲染管线里配对比较,发现前者在三类色度特征上都显著放大了条件传播,而匹配时间支撑与关系构成后差距大幅缩小,但全部证据仍限于单一生成器检查点与客观色度指标。 标签:#音乐生成 | #生成模型 | #音乐理解 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Weiwen Huang:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把局部三全音探针和完整识别器回放钉在同一生成器、同一轨道、同一窗口上硬碰硬,校准思路干净且在两条识别器路径上都复现了,值得肯定。但全部结论拴在一个冻结的 MIDI-SAG 检查点和 30 条配对窗口上,没有跨生成器、没有听感实验,所谓部署行为锚定更像是在自家渲染管线里自证。 📌 核心摘要 本文要回答歌声伴奏生成中局部合成和弦损坏能否代表部署时自动和弦识别输出的真实控制条件。做法是冻结人声轨道、生成器上下文、提示、种子与 12 秒评分窗,只切换和弦条件,对比中央 4 秒三全音替换与完整识别器序列回放经固定 MIDI-SAG 生成器后的输出传播,并用复制支撑掩码与关系构成计数的合成代理做校准。相对已有工作问生成器能否容忍错误和弦,本文转向评估问题,即局部探针与完整操作条件是否等价。在 30 条配对轨道上中央损坏在短时傅里叶变换色度、恒 Q 变换色度、色度能量归一化统计量三视图的变更目标效应与内部输出变化均大于卷积神经网络结合条件随机场完整回放,色度能量归一化统计量目标差距均值 0.462,29 条轨道为正。18 条独立诊断轨道上相对根音替换的整窗输出变化约为同根音质量翻转的 2.88 倍。支撑匹配与构成匹配各自大幅缩小回放距离,二者联合取得最低回放距离,并在深度色度结合条件随机场路径上复现。意义在于给出可复用的分离式评估协议,局部编辑测和声机制,完整回放锚定部署条件。局限是证据限于单一生成器检查点与有限筛选曲库,且以色度族客观特征为主而无主观听感验证。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 787 words