Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech

📄 十五秒换一个声音:当教师的错误变成学生的课本 英文题目:Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech 一句话:为解决无单人语料时难以部署泰语固定音色合成的问题,论文用零样本克隆教师做可编程数据源经严格过滤与拒绝采样蒸馏出 82M 学生,以挑战集 68.2% 关键词准确率和 91.4% 停顿精确率为证,代价是难词上限仍被教师覆盖锁死。 标签:#语音合成 | #知识蒸馏 | #低资源 | #多语言 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Kunat Pipatanakul:机构信息未在 arXiv HTML 中可靠披露 Potsawee Manakul:机构信息未在 arXiv HTML 中可靠披露 Warit Sirichotedumrong:机构信息未在 arXiv HTML 中可靠披露 Sittipong Sripaisarnmongkol:机构信息未在 arXiv HTML 中可靠披露 Pakorn Nathong:机构信息未在 arXiv HTML 中可靠披露 Phatrasek Jirabovonvisut:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把泰语停顿可接受集合形式化并配套可复现的评测管线,让合成流水线的取舍变得可度量。短板在于学生上限被教师分布锁死,挑战集关键词准确率始终落后教师与专有系统,蒸馏更多是在做有损压缩而非能力扩展。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1004 words

Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

📄 不抄答案抄思路:把蒸馏钉在量化器之前 英文题目:Compressing Streaming Neural Audio Encoders via Latent-Space Distillation 一句话:面向端侧听写的常驻音频编码器,论文用冻结教师的量化前潜变量做无标签回归蒸馏,在 2.8 倍压缩下六组师生有五组保持在 1.9% 相对词错误率内,同容量独立训练则落后 3.9%,代价是阶段一波动大且缺少替代目标的直接消融。 标签:#语音识别 | #知识蒸馏 | #模型压缩 | #多语言 评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Prasanth Yadla:Apple Mohammad Samragh:Apple Dongseong Hwang:Apple Mingbin Xu:Apple Yuanyuan Zhang:Apple Chung-Cheng Chiu:Apple Yongqiang Wang:Apple Yuan Liu:Apple Zhen Huang:Apple Xiaodan Zhuang:Apple 💬 毒舌点评 把蒸馏目标钉在量化器前潜变量上的选择干净利落,一份配方同时覆盖离散与连续两种入模接口值得肯定。但全文对为何不直接蒸馏离散标识或解码器输出只有动机论述而无实证对照,阶段一中有一组学生反超教师的异常现象也未被真正解释清楚。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 786 words

BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling

📄 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling 一句话:在 1.1 kbps 低码率下语义与声学互相挤压的矛盾中,BiMTokenizer 用双向 Mamba 时序建模与固定 Leech 格点量化重做单塔瓶颈,在 LibriSpeech 上以 PESQ-NB 3.56 与 WER 2.44% 超越同码率双塔基线,代价是离线双向依赖与 196560 大词表带来的自回归预测负担。 标签:#语音编码 | #端到端 | #语音合成 | #语音质量评估 | #知识蒸馏 评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1876 words

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

📄 7B 做原生音画同步:用门控与路由把对齐做轻,而不是把参数做大 英文题目:DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution 一句话:DreamX-Creator 以首帧与文本为条件让音视频双流联合去噪,用门控跨模态注意力与模态感知强化学习在 Verse-Bench 上以 VQ 与 DeSync 对抗大模型,并用自回归 1 步蒸馏把 2K 精修压到每块一次去噪,代价是音频美学与跨模态语义仍落后于 22B 与 33B 系统。 标签:#扩散模型 #流匹配 #强化学习 #知识蒸馏 评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jiashu Zhu:机构信息未在 arXiv HTML 中可靠披露 Yanhao Zheng:机构信息未在 arXiv HTML 中可靠披露 Ruitian Tian:机构信息未在 arXiv HTML 中可靠披露 Rujing Dang:机构信息未在 arXiv HTML 中可靠披露 Shen Zhang:机构信息未在 arXiv HTML 中可靠披露 Bingze Song:机构信息未在 arXiv HTML 中可靠披露 Jiachen Lei:机构信息未在 arXiv HTML 中可靠披露 Ruimin Lin:机构信息未在 arXiv HTML 中可靠披露 Jiahong Wu:机构信息未在 arXiv HTML 中可靠披露 Xiangxiang Chu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 以 7B 紧凑双流加门控跨模态注意力实现首帧条件原生音视频联合去噪,并配齐数据系统、RL 后训练与自回归 1 步 2K 精修的工程链路,开放权重定位清晰。硬伤是自家表格直接证伪全面领先叙事:音频美学与跨模态语义被 22B LTX-2.3 与 33B MiniMax-H3 全面压制,Verse-Bench 无显著性检验、无门控/奖励路由/蒸馏消融,所谓 democratizing 仍停留在承诺开源而非可验证交付。 ...

2026-09-01 · 更新于 2026-09-04 · 10 min · 1929 words

Knowledge Distillation for Efficient Acoustic Echo Control

📄 把教师的回声残差教给小模型:AEC 蒸馏到底补回了什么 英文题目:Knowledge Distillation for Efficient Acoustic Echo Control 一句话:这项工作把大 CGGN16 增强输出作为可学习目标,用频域蒸馏接 GT 微调,在不改变小学生推理规模的前提下挽回近端语音保真与回声抑制的部分损失。 标签:#回声消除 #知识蒸馏 #RNN #模型压缩 #高效推理 评分:8.5/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 💬 毒舌点评 本文没有把更小网络偷换成更差但便宜的网络,而是把教师增强输出变成学生学习目标,并用频域 KD→GT 的 2 阶段路径检验它。开发集和测试集都把近端保真与残余回声拆开看,0.2 M、0.25 G 的学生在双讲指标上整体回升,论证的是明确数据流,不是含混地宣称蒸馏有效。 需要保留的边界是:高效主要是参数量、FLOPS 与 40 ms 算法延迟账本,没有端侧实测功耗、峰值内存、实时因子或整机延迟;训练也只做回声抑制。编码器和 recurrent bottleneck 特征匹配没有超过无 KD 基线,说明 2 阶段 KD 的收益不能泛化成任意层级蒸馏都值得加入,部署收益也不能从 0.25 G FLOPS 自动推出。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 661 words

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

📄 Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds 标签:#音视频生成 #知识蒸馏 #多模态模型 #长音频处理 8.9/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.4/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频生成 | #知识蒸馏 | #多模态模型 #长音频处理 | arxiv 👥 作者与机构 第一作者:Nan Duan(Joy Future Academy, JD) 通讯作者:正文未明确标注 作者列表:Nan Duan、Haoyang Huang、Weiyang Jin、Haoran Li、Yaowei Li、Yuming Li、Yijun Liu、Xin Lu、Xiaoxiao Ma、Yanwen Ma、Yaofeng Su、Yilang Sun、Haoyu Wang、Zeyue Xue、Songchun Zhang、Junhao Zhuang(机构:Joy Future Academy, JD) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 419 words

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

📄 sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller 标签:#语音合成 #知识蒸馏 #模型压缩 #实时处理 10.0/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 10.0/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #语音合成 | #知识蒸馏 | #模型压缩 #实时处理 | arxiv 👥 作者与机构 第一作者:Ashish Thapa(正文未明确机构) 通讯作者:正文未明确标注 作者列表:Ashish Thapa(机构:正文未明确机构) 💡 毒舌点评 sanoTTS 的可信度来自“完整链真的在板上跑”和“每个 blob 都能核验”,而非参数数字。0.22× 实时、明确的参数拆分和开放 fixtures 很有工程价值。推荐给端侧语音与 TinyML 开发者;选型时必须同时看到 Kristin 的明显质量差距、24 句小门禁、缺 MOS/能耗,以及更高质量 Amy 包尚未实板部署。 ...

2026-08-25 · 更新于 2026-09-04 · 4 min · 644 words

DAVSS: Distilled Audio-Visual State Space Models

📄 DAVSS: Distilled Audio-Visual State Space Models 标签:#音视频理解 #知识蒸馏 #模型压缩 #高效推理 6.4/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频理解 | #知识蒸馏 | #模型压缩 #高效推理 | arxiv 👥 作者与机构 Saurabhchand Bhati 与 James Glass 来自麻省理工学院计算机科学与人工智能实验室(CSAIL);Mrudula Athi 与 Amit S. Chhetri 来自亚马逊(Amazon)。论文附有生成式 AI 使用披露,声明相关工具仅用于语法检查等基础编辑。 💡 毒舌点评 这篇论文的工程直觉值得肯定:用状态空间学生模型换掉视听分类里的 Transformer 主干,把联合建模层从不足 5% 加深到 30%,确实抓住了注意力二次复杂度限制融合深度的痛点。但宣传口径需要打折扣。摘要宣称「比 CAV-MAE 小 12 倍仍优于它」,引言却写着「小 3.5 倍」,同一篇论文里两个压缩倍数打架,暴露出写作的不严谨;而对照最终对比表,DAVSS-Medium 在 AudioSet 上仍落后 EquiAV 约 1.9 个 mAP,「优于现有视听模型」的说法只在「以小胜大」这个限定条件下成立。速度方面全文只给了相对推理时间的图,没有任何绝对时延或吞吐数字,效率主张难以落地验证。此外蒸馏收益高度依赖教师质量:换成多帧强教师后,在标准的十帧集成推理下学生性能几乎不动,说明这条路线的天花板被教师牢牢锁死——作者自己也承认未来要走出 CAV-MAE 家族找教师。 ...

2026-08-21 · 更新于 2026-09-04 · 3 min · 499 words

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

📄 AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model 标签:#音视频语音合成 #扩散模型 #知识蒸馏 #实时处理 #零样本 6.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频语音合成 | #扩散模型 | #知识蒸馏 #实时处理 | arxiv 👥 作者与机构 第一作者:Kwan Yun(韩国科学技术院文化技术研究生院博士生,共同第一作者) 共同第一作者:Serin Yoon(多伦多大学 DGP 实验室访问研究员,原韩国科学技术院文化技术研究生院硕士,论文标记为共同第一作者) 通讯作者:未说明 作者列表:Kwan Yun(韩国科学技术院文化技术研究生院)、Serin Yoon(多伦多大学 DGP 实验室访问研究员,论文标记共同第一作者)、Sunjin Jung(诚信女子大学计算机工程系助理教授)、Jung Eun Yoo(研发工程师,韩国科学技术院文化技术研究生院 2025 年博士毕业,具体公司未说明)、Inyup Lee(韩国科学技术院文化技术研究生院博士生)、Junyong Noh(韩国科学技术院文化技术研究生院教授) 💡 毒舌点评 这篇文章的切入点聪明:把 2D talking-head 视频扩散模型的运动先验“白嫖”到 3D blendshape 上,并用零音频嵌入做静帧微调,确实绕开了对 3D 动画数据的需求。但评测仍偏软:SyncNet 和用户研究不足以证明几何级口型正确性,蒸馏后的 AnyTalk_RT 在 LSE-D 上从 11.74 退化到 12.19、LSE-C 从 3.24 掉到 2.96,实时版的唇同步损失没有给出令人信服的补偿方案。此外,论文声称代码公开,但正文未给出可验证的仓库链接、模型权重或数据下载,开源可获取性存疑。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 868 words

Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement

📄 Speaker-Normalized Semantic Speech Tokens via Iterative S2U-T2U Refinement 标签:#语音编码 #知识蒸馏 #语音合成 #语音转换 #多语言 6.0/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音编码 | #知识蒸馏 | #语音合成 #语音转换 | arxiv 👥 作者与机构 第一作者:Hanlin Zhang(香港城市大学计算机科学系) 通讯作者:原文脚注声明存在通讯作者,但作者列表中未具体标出;邮件信息显示 Linqi Song(香港城市大学计算机科学系)和部分华为作者可联系 作者列表:Hanlin Zhang(香港城市大学计算机科学系)、Daxin Tan(华为莱布尼茨研究中心 AI Lab)、Dehua Tao(原文机构列表中含香港中文大学,但作者列表中未逐一标注对应关系)、Chengxi Deng(原文机构列表中含香港中文大学,但作者列表中未逐一标注对应关系)、Xiao Chen(华为莱布尼茨研究中心 AI Lab)、Linqi Song(香港城市大学计算机科学系) 💡 毒舌点评 亮点是文本可预测性作为 token 净化的过滤信号设计清晰,交替 S2U–T2U 回写带来显著的跨说话人序列一致性提升,UED 从 344.61 降到 59.44。短板是全文无代码、无权重、无训练超参数,speaker probe 的绝对改进只有 0.01 个百分点,且部分实验缺少统计显著性检验;此外原文中相对 R-Spin 的 UED 降幅 40.8% 与表内数值不一致,据表内数值计算约为 75.4%,暴露出结果报道的严谨性不足。归一化优势的整体证据链被这些弱项明显拖累。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 993 words