Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

📄 不数拍子也能合唱:对齐无关的配音与双人对话合成 英文题目:Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis 一句话:用 mT5 交叉注意力隐式对齐替代强制对齐与时长预测,结合 48 kHz DAC-VAE 隐变量流匹配统一单双通道生成,在内部配音基准可分享性提升约 0.40、短对话人类相似度 4.53 接近真人 4.62,代价是依赖闭源数据与多候选重排序。 标签:#语音合成 | #流匹配 | #语音克隆 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Sanyuan Chen:FAIR at Meta Min-Jae Hwang:FAIR at Meta Sho Inoue:FAIR at Meta Anna Sun:FAIR at Meta Bokai Yu:FAIR at Meta David Kant:FAIR at Meta Dongmin Hyun:FAIR at Meta Dorian Desblancs:FAIR at Meta Gregory Antonovsky:FAIR at Meta Oleg Repin:FAIR at Meta Peng-Jen Chen:FAIR at Meta Xutai Ma:FAIR at Meta Zehai Tu:FAIR at Meta Juan Pino:FAIR at Meta Wei-Ning Hsu:FAIR at Meta 💬 毒舌点评 把对齐无关文本接口、48 kHz低码率隐变量扩散与单双通道统一建模做成可落地的配音加全双工对话大系统,工程链条完整。短板是全程依赖内部数据与内部基线且无外部可验证产物,情绪与长对话评估多靠自动指标与自建主观量表,说服力打了折扣。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 839 words

Beyond .WAV: Design and Software Verification of VocalCap, a Traceable Browser-Based Audio Capture System for Vocal Biomarker Research

📄 不只留下一段波形:让每一次远程录音都能自证清白 英文题目:Beyond .WAV: Design and Software Verification of VocalCap, a Traceable Browser-Based Audio Capture System for Vocal Biomarker Research 一句话:远程自导录音只剩最终文件无法定位故障,VocalCap 用同一数据流的双产物加版本化规范与字节级溯源把采集变成可验收契约,受控边界与 39 例试点审计证实了拓扑感知等机制有效,代价是三份留存与仅限软件契约的验证范围。 标签:#语音质量评估 | #端到端 | #模型评估 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Augusto Camargo:Institute of Mathematics and Statistics, University of São Paulo, São Paulo, Brazil 💬 毒舌点评 把浏览器采集从单个 WAV 文件扩展为带字节完整性和变换溯源的可验收会话,工程闭环完整。短板是全部验证仍停留在软件契约层面,没有声学一致性、可用性和临床意义的任何外部证据,离嗓音生物标志物研究真正可用的采集验证还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1055 words

Broadband Acoustic Intensity Direction Estimation with Tight-Frame Cardioid Arrays

📄 把方向藏进声强里:二十四个心形话筒如何撑住低频到高频 英文题目:Broadband Acoustic Intensity Direction Estimation with Tight-Frame Cardioid Arrays 一句话:论文用消声室实测脉冲响应验证对置心形对做和差声强加紧框架平均的宽带测向链路,最强证据是多方向短间距组合在中弱干扰下全频段保持小角度跟踪误差,代价是单话筒顺序合成与相干叠加基准尚未检验真实多通道失配与混响。 标签:#声源定位 | #端到端 | #空间音频 | #多通道 | #鲁棒性 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Akira Omoto:Faculty of Design, Kyushu University, Fukuoka 815-8540, Japan 💬 毒舌点评 用对置心形话筒和差测声强、再靠紧框架平均扛到 20 kHz 的思路扎实,对做声强探头的人有直接参考价值。但全篇是单话筒转 26 个位置拼出来的阵列,多通道幅相失配与同步这个真痛点完全没碰,所谓多干扰也只是把实测脉冲响应转角度再相干叠加,并不是真实反射声场,2.5 度这种数字的外推力要打折扣。 📌 核心摘要 宽带声强测向长期受限于压差式探头有限差分近似的高频上限,本文用实测脉冲响应验证基于心形指向性的心形-心形配对(cardioid-cardioid,C-C)方法能否实现 50 Hz 到 20 kHz 的稳定指向。核心机制是对每个对置心形对做和差以估计声压与质点振速分量,再经希尔伯特变换构造解析信号并时域积分求径向有功声强,最后按紧框架(tight frame)方向向量加权求和重构三维正交强度并估计方位与俯仰。实验在消声室用单只 DPA 2012 心形话筒配合全景云台顺序测量 26 通道脉冲响应,声源为 2.5 m 前方 Genelec 8331,48 kHz 采样、5.5 s 扫频激励,由同一批数据合成 6 话筒正交阵 TF6 与 24 话筒多方位阵 TF24,对比对置间距 \(d=20\) mm 与 \(100\) mm。主结果是 TF24 加 \(d=20\) mm 在总干扰信号能量比 \(L_{J/S}=-20\) dB 与 \(-30\) dB 时全频段中值跟踪误差保持在 2.5 度以内,在 \(L_{J/S}=-10\) dB 时 5 kHz 以下在 5 度以内、高频约 7.5 度。该工作给出了可直接参考的阵形与处理链条,主要局限是顺序单话筒合成未评估多话筒个体差异与同步误差,且多波到达为旋转重标定加相干叠加的标准化基准而非真实反射复现。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 821 words

Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech

📄 十五秒换一个声音:当教师的错误变成学生的课本 英文题目:Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech 一句话:为解决无单人语料时难以部署泰语固定音色合成的问题,论文用零样本克隆教师做可编程数据源经严格过滤与拒绝采样蒸馏出 82M 学生,以挑战集 68.2% 关键词准确率和 91.4% 停顿精确率为证,代价是难词上限仍被教师覆盖锁死。 标签:#语音合成 | #知识蒸馏 | #低资源 | #多语言 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kunat Pipatanakul:机构信息未在 arXiv HTML 中可靠披露 Potsawee Manakul:机构信息未在 arXiv HTML 中可靠披露 Warit Sirichotedumrong:机构信息未在 arXiv HTML 中可靠披露 Sittipong Sripaisarnmongkol:机构信息未在 arXiv HTML 中可靠披露 Pakorn Nathong:机构信息未在 arXiv HTML 中可靠披露 Phatrasek Jirabovonvisut:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把泰语停顿可接受集合形式化并配套可复现的评测管线,让合成流水线的取舍变得可度量。短板在于学生上限被教师分布锁死,挑战集关键词准确率始终落后教师与专有系统,蒸馏更多是在做有损压缩而非能力扩展。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1004 words

CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback

📄 同样是二倍速,为何有人觉得高效、有人只想跳过 英文题目:CAPQ-FAST: Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback 一句话:倍速下的感知质量由速度与内容时间密度共同决定,论文用时间信息量、每分钟词数、每分钟节拍数分别刻画视频、语音、音乐的可跟随压力并以指数族加线性融合预测平均意见分,在受控小样本上取得高相关,但语义与个性化仍在模型之外。 标签:#音频质量评估 | #多模态模型 | #语音质量评估 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jiarun Song:机构信息未在 arXiv HTML 中可靠披露 Yuxin Song:机构信息未在 arXiv HTML 中可靠披露 Fuzheng Yang:机构信息未在 arXiv HTML 中可靠披露 Weisi Lin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把倍速下“想高效看还是想跳过”的模糊意图转成可计算的跨模态感知质量,有产品嗅觉;但全篇仍是小样本主观分拟合的指数曲线加线性融合,泛化证据和统计完备性撑不起个性化推荐的大叙事。 📌 核心摘要 本文研究在线音视频倍速播放下的感知质量退化,核心观察是同一速度对不同内容可对应高效观看与选择性跳过两种相反意图。作者提出内容自适应模型 Content-Adaptive Perceived Quality Assessment for Faster Audiovisual Playback (CAPQ-FAST),以播放速度 \(S\) 结合模态内时间密度预测平均意见分 Mean Opinion Score (MOS)意义下的质量:视频用时间信息量 Temporal Information (TI),语音用每分钟词数 Words Per Minute (WPM),音乐用每分钟节拍数 Beats Per Minute (BPM),再经音视频融合得到整体质量 \(Q\)。验证显示融合模型在语音视频和音乐视频上 Pearson Correlation Coefficient (PCC)达 0.976 和 0.968,优于不区分内容的同族基线。应用上用于播放速度推荐、自适应播放控制和意图粗粒度解释。局限是 72 名 22岁至28岁大学生被试、内容与语义覆盖有限,TI、WPM、BPM 只刻画时间密度而非语义重要性,外推到真实平台行为需谨慎。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 775 words

Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

📄 不抄答案抄思路:把蒸馏钉在量化器之前 英文题目:Compressing Streaming Neural Audio Encoders via Latent-Space Distillation 一句话:面向端侧听写的常驻音频编码器,论文用冻结教师的量化前潜变量做无标签回归蒸馏,在 2.8 倍压缩下六组师生有五组保持在 1.9% 相对词错误率内,同容量独立训练则落后 3.9%,代价是阶段一波动大且缺少替代目标的直接消融。 标签:#语音识别 | #知识蒸馏 | #模型压缩 | #多语言 评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Prasanth Yadla:Apple Mohammad Samragh:Apple Dongseong Hwang:Apple Mingbin Xu:Apple Yuanyuan Zhang:Apple Chung-Cheng Chiu:Apple Yongqiang Wang:Apple Yuan Liu:Apple Zhen Huang:Apple Xiaodan Zhuang:Apple 💬 毒舌点评 把蒸馏目标钉在量化器前潜变量上的选择干净利落,一份配方同时覆盖离散与连续两种入模接口值得肯定。但全文对为何不直接蒸馏离散标识或解码器输出只有动机论述而无实证对照,阶段一中有一组学生反超教师的异常现象也未被真正解释清楚。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 786 words

CRAW: Codec Robust Audio Watermarking

📄 被编解码器洗掉的水印:CRAW 如何把鲁棒性藏进听不见的地方 英文题目:CRAW: Codec Robust Audio Watermarking 一句话:针对神经编解码器与降噪重合成几乎清零现有音频水印的问题,CRAW 以加宽失真训练打底、注意力池化与感知掩膜回收音质、重复码补回容量,在 FACodec 上达到 0.974 检测 F1 而 PESQ 保持 3.990,代价是约 150 ms 推理延迟与 TiCodec 短板。 标签:#音频水印 | #对抗训练 | #语音编码 | #鲁棒性 评分:7.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.5/0.5 | 工程/实践 1/1.5 👥 作者与机构 David Chernin:机构信息未在 arXiv HTML 中可靠披露 Ethan Fetaya:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把失真池加宽、池化改注意力、推理加掩膜再用纠错码兜底的四件套分工清晰,对神经编解码器碾压式提升是真贡献。但掩膜依赖可微 PESQ 梯度且只在推理嫁接,训练推理不一致味道很重,最难的 TiCodec 仍是全场最低点,SI-SNR 与 STOI 也弱于最优基线,离真正透明部署还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 6 min · 1267 words

Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue

📄 何时闭嘴何时开口分开学:用真实重叠教会状态机的全双工配方 英文题目:Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue 一句话:针对合成带学不会真实打断与重叠时序的问题,该工作用人人语音学轮次、用可配人机文本保语义并以事件规则与来源感知损失缝合,在受控词量下轮次 F1 提升约 0.31、放量后语义距基座仅差 0.09,代价是单带仍压缩连续时间与副语言。 标签:#语音交互 | #大语言模型 | #流式处理 | #基准测试 评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yihang Li:Kyoto University Chenhui Chu:Kyoto University 💬 毒舌点评 把轮次控制与语义解耦、用真实人人对话学打断的思路切中了神经有限状态机合成数据的要害,事件引导的规则序列化做得扎实可扩展。但合成基线复现自由度偏大且语义评估口径不对等,暂停处理的激进策略也暴露了单带序列化压缩连续时间的固有代价。 📌 核心摘要 全双工对话需要同时处理打断、反向通道和地板争夺,而神经有限状态机将状态转换与回复生成序列化到单条因果带上,却依赖大语言模型合成难以还原真实声学时序的训练带。本文提出解耦数据方法,用真实人人口语对话学习轮次控制,用可配置的人机文本对话塑造语义,并以全规则的事件引导变换加来源感知校准损失实现联合训练。在控制训练token量的对比中,该方法在轮次F1与VoiceBench上均大幅超越合成基线,扩大到按比例上采样混合后语义基本恢复至基座模型零样本水平。实际意义在于为基于有限状态机的全双工系统提供了可扩展到任意人人语料且无需大语言模型标注的配方。主要边界是单带离散化必然损失连续时间与副语言信息,且当前仅覆盖双人问答场景。 🔗 开源与复现资源 代码: 仓库链接为 https://github.com/Liyht/def-fsm 模型权重: 论文中说明模型与代码均在 https://github.com/Liyht/def-fsm 获取,未提及独立HuggingFace或ModelScope权重链接 数据集: 采用Switchboard语料和Fisher语料作为人人口语对话,未提及获取链接,采用ShareGPT52K数据集作为人机对话,链接为 https://huggingface.co/datasets/RyokoAI/ShareGPT52K,另用GPT-4-Turbo生成1500个合成对话作为基线,未提及公开链接 Demo: 论文中未提及 复现材料: 基础模型为Qwen3-4B,人人与人机按1比1 token量混合,Fisher与Switchboard按4比1混合,来源感知校准损失设置tau为1且alpha为0.6,上下文长度为1024 token,峰值学习率为1.0e-5且warmup比例为0.03,token匹配设置训练至多300步,放量混合设置训练至多700步,细节见Appendix B.1和Appendix D 论文中引用的开源项目: Faster-Whisper,链接为 https://github.com/SYSTRAN/faster-whisper,Kokoro TTS,链接为 https://github.com/hexgrad/kokoro,另提及Whisper-Turbo和SimulStreaming和Silero VAD和Qwen3-32B,未提及对应链接 资源可达性验证:code=temporarily_unreachable;model=temporarily_unreachable;dataset=temporarily_unreachable;third_party=temporarily_unreachable;third_party=temporarily_unreachable 🧭 深度解读 人为什么能边听边想边插话? 想象你和朋友争论金星和火星哪个更大,你刚说到一半,对方轻轻嗯了一声,你自然继续讲下去。可当对方突然提高声音纠正你,你会立刻停下让对方说完。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 879 words

Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints

📄 压住房间的尾音:375bps 里留住混响的衰减骨架 英文题目:Deep Neural Compression for RIR-Characterized Acoustic Environments with Structure-Aware Constraints 一句话:针对通用神经编码器压缩房间脉冲响应时丢失衰减结构的问题,该工作在 EnCodec 单码本框架上加入能量衰减与混响语音两级约束,在 375bps 下把 T60 误差降到 1.14 秒、ViSQOL 做到 4.11,代价是仅在单房间验证且无开源。 标签:#音频编码 | #对抗训练 | #空间音频 | #模型压缩 评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Chen-Yuan Ning:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露 Xiao-Hang Jiang:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把房间脉冲响应当成特殊音频来压的思路切中了通用神经编解码器水土不服的痛点,能量衰减曲线与混响语音联合约束的设计颇为对症。遗憾在于验证只困在单一房间的 Motus 数据上,基线又弱又少,低码率极限的反常波动也缺乏解释,离顶会要求的普适性证据还有距离。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 967 words

Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition

📄 该归一的漏掉,不该归一的乱改:双形式识别如何管住数字 英文题目:Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition 一句话:中文语音识别同时要忠实记录怎么说、又要得体呈现怎么写,论文用提示词切换的口语与书面配对监督加数字敏感的序列优化,在必需归一上做到 4.64% I-CER 与 94.85% 关键词 F1、在禁用保留上做到 95.18% 保留率,代价是训练数字覆盖仅 4.4% 且评测局限于离线小规模人工集。 标签:#语音识别 | #语音大模型 | #大语言模型 | #基准测试 评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fengrun Zhang:机构信息未在 arXiv HTML 中可靠披露 Li Fu:机构信息未在 arXiv HTML 中可靠披露 Wangjin Zhou:机构信息未在 arXiv HTML 中可靠披露 Lu Fan:机构信息未在 arXiv HTML 中可靠披露 Youzheng Wu:机构信息未在 arXiv HTML 中可靠披露 Xiaodong He:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把中文逆文本归一化从级联后处理收编为提示词可控的双形式联合建模,并用 Require-ITN 与 Forbid-ITN 把该归一和不该归一拆开考核,是切中部署痛点的设计。短板是书面目标中含阿拉伯数字的时长仅占4.4%,评测只靠772条与309条的单一SpeechIO衍生集,序列级奖励相对验证后监督的增益有限却包装成核心方法贡献。 ...

2026-09-04 · 更新于 2026-09-04 · 2 min · 296 words