DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

📄 说了像本人,不等于接得住话:角色暗示里的时机考验 英文题目:DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents 一句话:论文用同一段用户语音对比显式规则与人设暗示下的接话时机,发现全双工模型推断代价最高达 9.7 个百分点,而内容像角色的模型仍做不出打断与附和,且安全冲突下仅一例过半守住安全侧。 标签:#语音交互 | #语音大模型 | #基准测试 | #实时处理 | #模型评估 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Puneet Mathur:University of Maryland College Park, USA Dinesh Manocha:Project Page: 💬 毒舌点评 把显式打断规则换成悲伤辅导员与911接线员的人设暗示来考全双工话轮控制,这个切口抓得准且泄漏控制做了实事。遗憾在于6个系统绝对指令遵从率普遍低于50%,近零差距模型的细排名在阈值抖动下并不稳,安全层级结论更多是30例小样本警示而非定论。 📌 核心摘要 全双工语音智能体需要根据角色推断何时倾听、附和、打断、让出或保持话轮,现有评测多只给显式话轮指令。论文提出DuplexSpeechBench-IFEval(DSB-IFEval,隐式指令遵循评测),用同一用户音频搭配5种条件协议对比显式执行与人设暗示执行。方法上以8个行为对比角色、6类会话探针、程序化合成与双通道实时编排为流水线,以确定性指令遵从分数Instruction Adherence Score(IAS,指令遵从分数)与大语言模型评价的人设内容分数Persona Adherence Score(PAS,人设遵从分数)解耦内容与时机。6系统实验显示全双工架构的蕴含差距Entailment Gap(蕴含差距)达9.7个百分点,而回合制系统内容跟随强但打断与附和几乎为0。安全冲突下仅MiniCPM-o-4.5在语义层60.0%选择安全侧,且IAS非零者仅2个系统。该基准为角色化实时语音部署提供了可复现的层级检验,但局限在英语双轮合成语音与小规模安全集。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 790 words

A Frequency-Domain Artificial Reverberator Plug-In

📄 当混响不再模仿房间:用声码器思路把噪声织成尾响 英文题目:A Frequency-Domain Artificial Reverberator Plug-In 一句话:FDverb 把稀疏时域早期反射与频域噪声载波尾响解耦,用逐频带包络跟随直接塑造噪声来生成高密度混响,并以可实时交互的开源插件证明了大块尺寸下仍可低 CPU 运行,代价是缺乏与现有混响的音质对比且大块带来数十毫秒固有延迟。 标签:#音频生成 #生成模型 #空间音频 #实时处理 #开源工具 评分:7.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Jonas Roth:机构信息未在 arXiv HTML 中可靠披露 Nishanth Kumar:机构信息未在 arXiv HTML 中可靠披露 Silvan Krebs:机构信息未在 arXiv HTML 中可靠披露 David Wieland:机构信息未在 arXiv HTML 中可靠披露 Christoph Studer:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把相位声码器式频域噪声载波混响做成了可实时交互的 JUCE 插件,并加入了非物理的非线性衰减与音高漂移等声音设计玩法,工程完整度远超一般算法短文。短板是全文几乎没有可验证的声学或主观评价证据,创新停留在对 [2][3] 类经典频域衰减思路的工程化重组与参数化,学术增量与严谨性难以支撑顶会方法论文标准。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 814 words

Alias-Free Oscillator Synchronization via Additive Synthesis

📄 把截断搬进频域:用 sinc 重采样让振荡器同步不再混叠 英文题目:Alias-Free Oscillator Synchronization via Additive Synthesis 一句话:论文把硬同步的时域重置重写为傅里叶系数上的 sinc/versinc 线性重采样,再用带限加法合成直接生成无混叠波形,并以 65nm 的 HASY 芯片在 42 微秒内完成 512 阶变换来证明实时可行,但代价是面积与功耗翻倍且 P<1 时精度系统性下降。 标签:#音乐生成 #生成模型 #实时处理 #高效推理 评分:7.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Jonas Roth:机构信息未在 arXiv HTML 中可靠披露 Domenic Keller:机构信息未在 arXiv HTML 中可靠披露 Oscar Castañeda:机构信息未在 arXiv HTML 中可靠披露 Christoph Studer:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把硬同步的时域截断重写为频域线性重采样,用 \(sinc\) / \(versinc\) 闭式变换统一处理任意波形并直接给出无混叠加法合成,理论干净且可扩展到 mirrored 与 pulsar 两种软同步。短板是验证仅靠与浮点黄金模型和解析截断的 SINAD 对比,缺乏与 BLEP / BLIT 等主流抗混叠基线的听感或频谱对比,且流片芯片存在控制逻辑错误导致无法全功能实测,系统报告的说服力被大幅削弱。 ...

2026-08-31 · 更新于 2026-09-04 · 2 min · 253 words

Acoustic Echo Control Based on Sound Object Identification for Suppressing Howling Caused by Complicated Acoustic Paths

📄 不估路径,先认出声音:跨终端啸叫为何要改用对象门控 英文题目:Acoustic Echo Control Based on Sound Object Identification for Suppressing Howling Caused by Complicated Acoustic Paths 一句话:这篇论文用“默认静音、确认非同一才放行”的声音对象门控,把难以建模的跨终端回授路径改写为重复对象的本地阻断;它能在特定仿真中压住持续啸叫,却把身份误判与语音可懂度损失暴露为必须正面优化的代价。 标签:#回声消除 #音频事件检测 #实时处理 #工业应用 评分:4.9/10 | 创新 1.1/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.5/1.5 💬 毒舌点评 这篇稿最可取的贡献,是把跨终端啸叫从“估计固定路径再相减”改成“默认静音、确认非同一才放行”的对象门控;发送与播放各守相应链段,图 2 也把它嵌入既有通话链路的位置画清楚。它因此给出了值得继续检验的因果单位,而非只把传统 AEC 换名。 但它仍是特定仿真中的可行性演示:没有公开基准、强基线、客观质量指标或部署测量,图 3 的 K–M 还显示误放行与过度静音。持续啸叫受抑不能推出真实会议中的可懂度、鲁棒性或整体体验已经合格;硬静音会切碎目标语音的代价仍需用直接比较来回答。 📌 核心摘要 这篇论文用“默认静音、确认非同一才放行”的声音对象门控,把难以建模的跨终端回授路径改写为重复对象的本地阻断;它能在特定仿真中压住持续啸叫,却把身份误判与语音可懂度损失暴露为必须正面优化的代价。不估计难以建模的端到端路径,而是默认静音,只有当前对象被判为不同于近期缓存对象时才发送或播放。它在发端和收端各设一道门,因此理论上可切断经服务器、编解码和非线性处理绕回来的重复对象。手动静音无法可靠协调多个终端,所以系统需要在信号层面而不是靠用户纪律断开回授。 验证实现只是幅度谱余弦相似度门控,并非训练好的识别模型。在 2 间房、3 个终端仿真中,AEC 约 13 s 收敛后,单讲识别错误相对较少,持续啸叫受抑;未控制条件的啸叫约在 2–3 s 后出现。双讲和 3 人重叠时仍可压住持续啸叫,但误放行会带来短暂回声,保守静音则会破碎目标语音并降低可懂度。 ...

2026-08-27 · 更新于 2026-09-04 · 2 min · 366 words

Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications

📄 把电话声道和业务词汇分开付账:Canary 的两次适配实验 英文题目:Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications 一句话:这份报告的可取之处不在于把 Canary 包装成万能电话 ASR,而在于用真实通话与可控增强补电话声道、再以姓名地址阶段换取业务词汇准确率,并把这笔专化回退明确暴露出来。 标签:#语音识别 #领域适应 #实时处理 #工业应用 评分:7.9/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 💬 毒舌点评 这篇报告最扎实的优点,是把真实通话、提示录音和电话化增强拆成可理解的采集分工,并把姓名地址的 3.78% 与一般电话的 10.89% 一起呈现。姓名地址实验最重要的不是 3.78% 本身,而是它与 10.89% 一起呈现专化代价;加上 180M 的 RTFx 601.8,读者能看到面向生产的真实取舍。 但证据仍像内部上线复盘:内部参与者、内部泰语电话集和单张 A100 不能支撑普遍部署结论。延迟只在单一硬件和 batch size 下测量,生产并发、排队和成本并没有被这张 RTFx 表覆盖;又缺少 real-call、mu-law 与噪声各自贡献的消融,生产上仍可能需要模型路由或混合训练。 ...

2026-08-27 · 更新于 2026-09-04 · 3 min · 428 words

Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans

📄 别等整句说完:把数字人的手势变成一条受因果约束的数据流 英文题目:Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans 一句话:Super Star 的价值在于把离线动作质量与在线因果约束分给不同的数据流:用非因果合成器造训练数据,却让部署端只从截至当前的语音和动作历史预测下一步。 标签:#音视频交互 #自回归模型 #Transformer #流式处理 #实时处理 评分:6.9/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5 💬 毒舌点评 Super Star 最扎实的地方,是没有把“流式”只当成演示词:在线端把 audio-conditioned cross-attention 的因果约束同时放进训练和推理,并用四部位 motion token 把局部动作动力学与全身历史接起来。Table 1 与 Table 2 的 FGD、BC、Diversity 和单步延迟是同一口径下的联合证据,尤其 JIYI 上的 mask 消融确实让因果对齐这一机制有了可反驳的抓手。 该泼冷水的地方也很具体:1.623 ms 是 gesture generation module 的每步数,不是用户说话到可见数字人反应的端到端实测;响应模块首 audio token 约 234 ms,渲染和网络却没有被纳入同一延迟表。self-evolution 的 2 轮结果很诱人,但 preferred online 样本规模、真实部署覆盖和长期负反馈行为都未报告,不能把固定 120 帧历史窗下的稳定手势延迟升级成已验证的全系统实时陪伴。 ...

2026-08-27 · 更新于 2026-09-04 · 3 min · 543 words

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

📄 Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra 标签:#音乐生成 #音频生成 #实时处理 #理论分析 #开源工具 8.7/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐生成 | #音频生成 | #实时处理 #理论分析 | arxiv 👥 作者与机构 第一作者:Antonio Argentieri(Conservatorio Niccolò Piccinni di Bari) 通讯作者:Antonio Argentieri;Francesco Scagliola 作者列表:Antonio Argentieri、Francesco Scagliola(机构:Conservatorio Niccolò Piccinni di Bari, Bari, Italy) ...

2026-08-26 · 更新于 2026-09-04 · 1 min · 145 words

One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output

📄 One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output 标签:#音乐生成 #端到端 #开源工具 #实时处理 7.0/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #端到端 | #开源工具 #实时处理 | arxiv 👥 作者与机构 第一作者:Francesco Vitucci(Conservatorio di Musica “N. Piccinni” di Bari) 通讯作者:正文未明确标注通讯作者,仅列出 3 位作者邮箱 作者列表:Francesco Vitucci、Michele Lorusso、Francesco Scagliola(机构:正文只明确给出 Conservatorio di Musica “N. Piccinni” di Bari,其余机构栏为空) ...

2026-08-26 · 更新于 2026-09-04 · 7 min · 1313 words

A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation

📄 A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation 标签:#回声消除 #模型压缩 #高效推理 #实时处理 #理论分析 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 ✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #回声消除 | #模型压缩 | #高效推理 #实时处理 | arxiv 👥 作者与机构 第一作者:Ruibin Hou(The College of Computer Science and Technology, Inner Mongolia Minzu University, Tongliao, 028000, Inner Mongolia, China) 通讯作者:正文未明确标注 作者列表:Ruibin Hou、Chenggang Zhang、Yufeng Diao(机构:The College of Computer Science and Technology, Inner Mongolia Minzu University, Tongliao, 028000, Inner Mongolia, China) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 635 words

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

📄 sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller 标签:#语音合成 #知识蒸馏 #模型压缩 #实时处理 10.0/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 10.0/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #语音合成 | #知识蒸馏 | #模型压缩 #实时处理 | arxiv 👥 作者与机构 第一作者:Ashish Thapa(正文未明确机构) 通讯作者:正文未明确标注 作者列表:Ashish Thapa(机构:正文未明确机构) 💡 毒舌点评 sanoTTS 的可信度来自“完整链真的在板上跑”和“每个 blob 都能核验”,而非参数数字。0.22× 实时、明确的参数拆分和开放 fixtures 很有工程价值。推荐给端侧语音与 TinyML 开发者;选型时必须同时看到 Kristin 的明显质量差距、24 句小门禁、缺 MOS/能耗,以及更高质量 Amy 包尚未实板部署。 ...

2026-08-25 · 更新于 2026-09-04 · 4 min · 644 words