Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models

📄 复述一句就能听出你来过:微调语音如何记住嗓音与录音 英文题目:Hearing the Whispers: Black-Box Membership Inference Attacks on Finetuned TTS Models 一句话:论文把双条件查询与变长波形比较形式化为可评分范围与记忆诱发两条准则,用朗读查询加声纹与多层 WavLM 加动态规整的解耦表征实现说话人与记录两级审计,在三模型两数据集上达到 0.80 以上 AUC 而代价是记录级需影子模型与十次重复查询。 标签:#语音合成 | #生成模型 | #说话人验证 | #自监督学习 评分:7.5/10 | 创新 1.7/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kunlin Cai:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Kaiyuan Zhang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Zihang Xiang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Jinghuai Zhang:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Abeer Alwan:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Fnu Suya:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. Yuan Tian:University of California, Los Angeles University of Tennessee, Knoxville Equal contribution. 💬 毒舌点评 把文本加参考语音双条件查询空间形式化并用可评分范围与记忆诱发解释朗读查询最强,表征上说话人级走全局声纹、记录级走多层帧特征加动态时间规整的解耦切中语音变长连续痛点。短板是记录级依赖同架构影子模型训练的轻量长短期记忆网络判别器,跨架构迁移未验证,防御评估停留在早停、输入扰动和差分隐私随机梯度下降的粗粒度尝试。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 1026 words

PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment

📄 先找到证据,再敢打分:PhoenixNest-Video 如何让面试评分可回放 英文题目:PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment 一句话:针对视频面试评分不透明、通用大模型系统性跑偏的问题,PhoenixNest-Video 用语义视频图加检索校验与双奖励强化学习把每个分数锚定到可回放证据,在自采面试集上以 8B 模型达到 91.50% 等级准确率,代价是核心数据不公开且证据判断仍依赖大模型自身。 标签:#音视频理解 | #强化学习 | #多模态模型 | #可解释性 评分:6.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fan Yuxuan:The Hong Kong University of Science and Technology (Guangzhou) Huang Miaojun:The Hong Kong University of Science and Technology (Guangzhou) Zhang Haimei:The Hong Kong University of Science and Technology (Guangzhou) Wu Jingshen:The Hong Kong University of Science and Technology (Guangzhou) Liu Hao:The Hong Kong University of Science and Technology (Guangzhou) 💬 毒舌点评 亮点在于把评分锚定到可回放的证据链而非直接输出分数,并用双奖励把机构分级校准显式写入优化目标,思路贴合高风险评审的审计需求。短板在于核心数据集不公开且关键证据多依赖大模型自判自证,证据可追溯性与评分客观性都仍系于未经验证的模型判断。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 964 words

Predictors of Loneliness in Older Adults Using Multimodal Analysis of Speech and Language

📄 孤独听得出来吗:当说什么比怎么说更诚实 英文题目:Predictors of Loneliness in Older Adults Using Multimodal Analysis of Speech and Language 一句话:这项研究用 310 位老人的 1465 次电话随访检验了语言内容与声音特征对孤独感的关联,发现文本更稳、声音在特定人群更灵,而两者合在一起也只能解释很小一部分差异。 标签:#语音情感识别 | #多模态模型 | #模型集成 | #医疗音频 评分:4.9/10 | 创新 0.7/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5 👥 作者与机构 Vinmay Khandode:机构信息未在 arXiv HTML 中可靠披露 Sai Karthik Kosuri:机构信息未在 arXiv HTML 中可靠披露 Neil K. R. Sehgal:机构信息未在 arXiv HTML 中可靠披露 Adam Greene:机构信息未在 arXiv HTML 中可靠披露 Elif Alpoge:机构信息未在 arXiv HTML 中可靠披露 Elana Duffy:机构信息未在 arXiv HTML 中可靠披露 Matthew Lee Smith:机构信息未在 arXiv HTML 中可靠披露 Thomas K.M. Cudjoe:机构信息未在 arXiv HTML 中可靠披露 Sharath Chandra Guntuku:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把自然电话随访中的说什么和怎么说放在同一回归与参与者层面验证下硬碰硬,并做了性别与种族分层,问题意识诚实克制。硬伤是关联与预测效应整体微弱,重复测量的非独立性与声学侧多重比较处理粗糙,所谓多模态增益只是特征堆叠的边际红利,离可部署筛查还很远。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 718 words

Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living

📄 关掉麦克风不行,擦掉人声才行:助老监听的隐私防火墙 英文题目:Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living 一句话:针对居家助老声音监测不敢录下谈话的落地难题,论文把语音剥离做成传感器后端防火墙,用全合成训练的 U 型谱映射 suppress 可检出语音并尽量保住活动识别,在轻干扰下恢复接近无语音基线,但重语音与真实强干扰下的不可懂性仍未被证明。 标签:#音频分类 | #迁移学习 | #语音活动检测 | #医疗音频 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Pavlos Nicolaou:KIOS Research and Innovation Center of Excellence, University of Cyprus, Panepistimiou 1, Aglantzia, Nicosia, 2109, Cyprus Christos Efstratiou:School of Computing, University of Kent, Canterbury, CT2 7NZ, Kent, United Kingdom 💬 毒舌点评 把语音去除做成助老传感前端防火墙并坚持全合成训练,问题来自真实护理院部署痛点,链路完整值得肯定。但隐私证据几乎只靠语音活动检测(Voice Activity Detection / VAD)清零,且评估分支经过有损梅尔逆变换加Griffin-Lim重合成,所谓0%更多是检测器失明而非语音不可懂,强语音与多说话人家庭仍是外推。 ...

2026-09-03 · 更新于 2026-09-04 · 6 min · 1227 words

Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction

📄 导演喊“再来一条”时,机器如何既不变声又听懂弦外之音 英文题目:Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction 一句话:为解决同一脚本下相对化重读三元组稀缺问题,该文用印象可控合成造风格对再由大语言模型反推导演语言,并在冻结骨干嵌入空间以流匹配学习增量,主证据是伪数据与真人数据组合在保住音色的同时提升方向跟随,代价是伪数据韵律偏保守且评估部分同源。 标签:#语音合成 | #流匹配 | #大语言模型 评分:6.8/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kenichi Fujita:机构信息未在 arXiv HTML 中可靠披露 Yusuke Ijima:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点是用印象可控合成加相对差分生成方向文本,把难以采集的导演式重读三元组做成了可扩展流水线。短板是伪数据韵律变化幅度明显弱于真人表演,导致伪数据模型偏保守,而对齐度评估又与构造用估计器同源,可信度打了折扣。 📌 核心摘要 本文研究方向跟随语音合成(direction-following TTS),即在保持说话人身份和文本内容不变的前提下,根据自然语言表演方向(direction)对参考 utterance 做相对化风格修改。核心机制是先用印象可控零样本合成模型生成风格差异对,再用印象估计器计算相对印象差并交由大语言模型(large language model,LLM)撰写导演式方向文本,从而构造伪三元组(pre-mod utterance,伪方向,post-mod utterance)。风格修改本身通过固定骨干合成模型之上的方向条件风格精修器(direction-conditioned style refiner)实现,该精修器在语音嵌入空间中学习从修改前嵌入到修改后嵌入的增量映射。与绝对风格标注和直接文本提示语音合成(text-prompted TTS)的区别在于建模相对变换而非绝对风格。主实验显示组合伪数据与真实录制数据的 Full 配置在已见说话人上主观说话人相似度(SMOS)达到 3.35,同时主观对齐度(AlignMOS)达到 3.22,兼顾了稳定性和表现力。实际意义是为导演式重读和可控表演合成提供了可扩展的数据范式。主要边界是伪数据表现力保守且评估部分依赖同源估计器,跨语言和开放方向泛化仍待验证。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 814 words

Sensing Bone-Conducted Speech with Earbuds

📄 耳塞在震动什么:骨导语音的低频直线与单轴传感器的容差 英文题目:Sensing Bone-Conducted Speech with Earbuds 一句话:这项工作用两款耳塞的同步测量标定佩戴者语音诱发的机壳振动,证明高功率集中在 400 Hz 以下且沿耳道口内外直线振动,使有利安装的单轴传感器仅损失 0.7 至 1.5 dB,而高频与机型差异仍需多轴与更低本底来覆盖。 标签:#语音增强 | #端到端 | #鲁棒性 | #工业应用 评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Christoph Weyer:Institute of Communication Systems (IKS), RWTH Aachen University, Aachen, Germany Peter Jax:Institute of Communication Systems (IKS), RWTH Aachen University, Aachen, Germany 💬 毒舌点评 把耳塞壳体振动这个长期凭经验用的模态做了频域加空间的联合标定,并给出单轴替代三轴的定量衰减依据,工程指向清晰。短板是17人中14男3女且多为欧洲背景、仅两款耳塞、无下游增强或检测验证,高频结论受三轴器件本底限制,向通用形态与真实噪声外推仍单薄。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 853 words

SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval

📄 一条声音,二十四种说法:SonicCaps 把听觉歧义变成检索的养分 英文题目:SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval 一句话:针对音频描述过于粗糙且一对一配对难以反映听觉一对多歧义的问题,论文用音频加文本联合驱动的多粒度复述构建约 70 万音频约 1500 万描述的 SonicCaps 并在训练中按分布采样,使 AudioCaps 文本到音频 R@5 达到 79.5%,代价是依赖单一多模态大模型分辨率且质量与多样性度量仍显粗糙。 标签:#音频检索 | #对比学习 | #音频字幕生成 | #数据集 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Zineb Lahrichi:Sony CTC, France LTCI, Telecom Paris, Institut polytechnique de Paris, France Marc Ferras:Sony CTC, France LTCI, Telecom Paris, Institut polytechnique de Paris, France Gaël Richard:Sony CTC, France LTCI, Telecom Paris, Institut polytechnique de Paris, France Geoffroy Peeters:Sony CTC, France LTCI, Telecom Paris, Institut polytechnique de Paris, France 💬 毒舌点评 把多样性做成了训练时可采样的监督分布而非装饰性统计,用大规模多粒度复述直接推高对比学习的泛化,这个切入点扎实。短板是质量与多样性的度量仍粗糙,主观实验仅25人375次评价且困惑度只刻画采样分布不刻画语义差异,让核心因果论证略显单薄。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 972 words

SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper for Low-Resource Nepali Financial Speech Recognition

📄 念对了也白搭:尼泊尔金融语音里被格式卡住的钱包 英文题目:SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper for Low-Resource Nepali Financial Speech Recognition 一句话:针对通用尼泊尔语识别在金融指令上数字全错且输出写法无法解析的问题,该工作用 403 条金融语音加 LoRA 适配 Whisper large-v2,把 WER 指标从 WER 129.95% 降到 WER 42.58%,把 TSR 指标从 TSR 1.67% 提到 TSR 33.33%,代价是绝对成功率仍远离支付可用线且测试仅 60 条。 标签:#语音识别 | #参数高效微调 | #低资源 评分:6.1/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Biraj Subedi:Independent Researcher 💬 毒舌点评 把低资源金融语音的领域失配讲清楚并配了可部署链路,诚实到连说话人重叠和分类漏洞都自曝。短板在于 60 条测试集要撑起 20 倍任务增益的故事,绝对性能仍远离可用线,更像扎实的应用报告而非顶会方法突破。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 923 words

The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

📄 剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本 英文题目:The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 一句话:针对联合音视频生成中音画互相同步却共同偏离剧本时间的问题,论文用时长归一化的加性时间路由把镜头与对白区间送进双分支交叉注意力,在 200 个剧本上把镜头边界误差从 1.11 秒降到 0.042 秒、对白准时率提到 84.1%,代价是评测仍锁在短剧对白域且零开源。 标签:#音视频生成 | #流匹配 | #参数高效微调 | #多模态模型 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yichen Liu:机构信息未在 arXiv HTML 中可靠披露 Quanwei Zhang:机构信息未在 arXiv HTML 中可靠披露 Haozhe Wang:机构信息未在 arXiv HTML 中可靠披露 Donghao Zhou:机构信息未在 arXiv HTML 中可靠披露 Xiaojie Li:机构信息未在 arXiv HTML 中可靠披露 Yang Shi:机构信息未在 arXiv HTML 中可靠披露 Jiaming Liu:机构信息未在 arXiv HTML 中可靠披露 Ruihua Huang:机构信息未在 arXiv HTML 中可靠披露 Yingtian Zou:机构信息未在 arXiv HTML 中可靠披露 Daquan Zhou:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把剧本时间从文本字符串里拽出来做成双模态注意力偏置,治好了音画很同步但集体演错时间的毛病,匹配算子对照也算体面。硬伤是全套数据、训练、评测都锁在自家短剧闭环里,基线文本带时间本就不公平,检测器既当教练又当裁判,还零开源,离可复现的剧本驱动标准差一口气。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 905 words

Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing System

📄 先分好组再混音:为什么两阶段不是技巧,而是分工 英文题目:Understanding Automatic Mixing: A Subtask-Oriented Analysis of Two-Stage Mixing System 一句话:论文把自动混音拆成可干预的分组与组内组间两阶段,用三组听感实验说明全混模型迁移看模型、分错组比响度错更难补、而保持模型不变只换输入就能显著提升,但结论受三首歌与小样本听音的限制。 标签:#音乐生成 | #生成模型 | #Transformer | #模型比较 评分:7.0/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Jinjie Shi:机构信息未在 arXiv HTML 中可靠披露 Wei Hua:机构信息未在 arXiv HTML 中可靠披露 Kunzhu Xie:机构信息未在 arXiv HTML 中可靠披露 Make Li:机构信息未在 arXiv HTML 中可靠披露 Yuchen Liu:机构信息未在 arXiv HTML 中可靠披露 Joshua Reiss:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把两阶段混音从工程惯例拆成可干预的分组与组内平衡变量,用同一套听感流程检验迁移、误差传播与分解增益,问题切得准,对系统选型有直接参考价值。硬伤是只用3首密集流行摇滚片段和18名有效听音人支撑全部结论,曲风、曲目与听众代表性都窄,部分关键比较还受地板效应和轨数兼容处理的混淆,结论外推要打折。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 872 words