共分析 42 篇论文


⚡ 今日概览

✅ 筛选入选 42 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#文本到语音5 篇█████
#语音识别5 篇█████
#音频问答4 篇████
#语音伪造检测3 篇███
#音频分类3 篇███
#语音情感识别2 篇██
#音乐理解2 篇██
#全双工语音交互1 篇█

📊 论文评分排行榜(42 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding8.7前25%方法研究#语音编码
🥈X-AuT: Progressive Audio-Encoder Compression for…8.1前25%方法研究#语音识别
🥉AudioICL-Bench: A Benchmark for Large Audio Language…7.9前25%数据集与基准#音频理解
4.Domain-Incremental Learning for Multi-Channel Replay…7.8前25%方法研究#语音伪造检测
5.Not All Attacks Are Learned Equally in Speech Deepfake…7.7前25%方法研究#语音伪造检测
6.Automatic Lyric Transcription for Greek Songs: Scaling…7.2前50%数据集与基准#语音识别
7.SEAR: Segment-Evidence-Aware Routing for Weak-to…7.2前50%系统技术报告#音频问答
8.Downstream-Task-Aware Unified Source Separation7.1前50%方法研究#语音增强
9.The Machines Are Calling: Measuring Automated and…7.1前50%应用研究#语音伪造检测
10.Assessing the Reusability of Public Speech Resources…7.1前50%应用研究#文本到语音
11.Preference Optimization with LALM Feedback for…7.1前50%方法研究#文本到语音
12.EConv-TasNet: Efficient Conv-TasNet for Effective…7.1前50%方法研究#语音分离
13.Post-Training Zero-Shot TTS for Fine-Grained Emotion…7.1前50%方法研究#文本到语音
14.The Eloquence submission for Task 2 of the Interspeech…7.1前50%系统技术报告#音频问答
15.Learned Continuous Synthesis of Quadratic Difference…7.0前50%方法研究#音乐生成
16.Xiaomi-CocktailASR-1 Technical Report7.0前50%系统技术报告#目标说话人提取
17.Continuous-Time Acoustic Modelling with Neural…7.0前50%方法研究#文本到语音
18.Diarization Error Decomposition Under Pause Annotation…6.9前50%方法研究#说话人分离标注
19.OmniHallu: Unified Hallucination Detection for Cross…6.8前50%数据集与基准#音频字幕生成
20.Component-Aware Differential Privacy for Federated…6.8前50%方法研究#语音识别
21.TART: A Modular Tool for Technique-Aware Audio-to…6.8前50%系统技术报告#音乐转录
22.LLM-Anchored Paralinguistic Enrichment for Alzheimer’s…6.7前50%方法研究#病理语音评估
23.Multi-Faceted Evaluation and Mitigation of Emotion…6.7前50%方法研究#语音情感识别
24.Investigating catastrophic forgetting in sound event…6.6前50%方法研究#音频分类
25.Less can be More: What Aspects of Speech Drive End-of…6.5前50%方法研究#轮次切换
26.Whisper-Based Speech Transcription from Videos Across…6.5前50%系统技术报告#语音识别
27.RetroThinker: Enabling Retrospective Thinking in…6.5前50%方法研究#音频问答
28.From Metrics to Natural Dialogue: French Full-Duplex…6.4前50%数据集与基准#全双工语音交互
29.Low-Latency State Space Voice Activity Detection with…6.4前50%方法研究#语音活动检测
30.Beyond Word Error Rate: A Switch Aware Evaluation of…6.4前50%数据集与基准#语音识别
31.Sparse Weight and Edge Circuit Discovery in…6.2前50%方法研究#音频分类
32.Complex-Text Robustness Evaluation and Failure…6.2前50%数据集与基准#文本到语音
33.Flexible and Interpretable Accent Distance Measurements6.1前50%方法研究#语言识别
34.Multimodal Temporal Modeling for Continuous Group…6.0前50%数据集与基准#语音情感识别
35.Nuha-Speech: Building General-Purpose Arabic Speech…6.0前50%数据集与基准#音频问答
36.A General Approach to Enharmonicism5.9前50%理论研究#音乐理解
37.Project Qualia: Recovering Experiential Music…5.9前50%数据集与基准#音乐理解
38.Bridging Echolocation Gaps in Automated Beaked Whale…5.7前50%应用研究#声源追踪
39.Exploring Second-Order Pattern Recognition in Speaker…5.3后 50%方法研究#说话人识别
40.Copying Versus Randomization in Lempel-Ziv Music…5.3后 50%方法研究#符号音乐生成
41.A Voice-Interactive Multi-Agent System for Smart…5.0后 50%系统技术报告#语音交互
42.Processing and classifying bird songs using wavelet…3.9后 50%应用研究#音频分类

📋 论文列表

🥇 把每秒 token 压到 6.25 个:ZipCodec 如何在流式与 160 ms 时延下保住语义和音质

英文题目:ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding

标签:#语音编码 | #向量量化 | #知识蒸馏 | #流式处理

评分:8.7/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Luca Della Libera:机构信息未在 arXiv HTML 中可靠披露
  • Cem Subakan:机构信息未在 arXiv HTML 中可靠披露
  • Mirco Ravanelli:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音编码需将波形压缩为可供语音语言模型建模的离散序列,帧率越低则序列越短,但单词元需同时保留语言内容、韵律、音色与声学细节,重建质量与流式因果约束难以兼得。ZipCodec先以因果对数梅尔前端提取100赫兹声学特征并经时域分块16倍下采样至6.25赫兹瓶颈,再以因果ErfFormer建模长时依赖并经标量球面量化离散化,接着由解压缩器将离散表示恢复为50赫兹WavLM第六层语义特征,最后由流式Vocos声码器在160毫秒窗内联合合成波形。相对FocalCodec-Stream,其关键差异在于去除归一化与位置编码的可扩展Transformer主干、可分解大码本的紧凑球面量化瓶颈,以及窗内允许非因果卷积的延迟感知解码,从而在不增加理论延迟下利用窗内未来上下文。在LibriSpeech test-clean英语重建评测任务下,ZipCodec的UTMOS为3.89,高于FocalCodec-S@50的UTMOS 3.85。判别式下游以上采样后50赫兹特征保留语言与说话人信息,生成式增强与分离直接在6.25赫兹短序列上建模,单流在消费级中央处理器上达1.33倍实时且理论延迟为160毫秒。结论适用边界受限于以英语朗读为主的约94000小时蒸馏训练与浅层探针验证,尚未验证长尾噪声对话、音乐通用性、超长流稳定性与端到端语音语言模型建模收益。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥈 剪层扰动解码接口后如何恢复:X-AuT 的渐进压缩与跨尺度蒸馏

英文题目:X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation

标签:#语音识别 | #模型剪枝 | #知识蒸馏 | #高效推理

评分:8.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Haojun Zhang:XPeng Inc.
  • Yi Zou:XPeng Inc.
  • Min Chen:XPeng Inc.
  • Qize Yu:XPeng Inc.
  • Lianrui Fan:XPeng Inc.
  • Xini Ding:XPeng Inc.
  • Hao Li:XPeng Inc.
  • Shuchang Zhou:XPeng Inc.
  • Xianming Liu:XPeng Inc.
  • Shiyu Huang:XPeng Inc.

📌 核心摘要

输入为语音波形,输出为中英文转写文本,实际难点在于直接删除音频编码器整层会扰动送入解码器的桥接嵌入并诱发删除与提前结束符错误。方法首先以转写一致性过滤构建最高一致层训练池,为后续恢复提供干净监督并重加权目标域来源。接着在每跳剪枝前用短预算行为探针在匹配初始化与数据下比较候选层组合的可恢复性,其选中组合直接决定下一步的学生初始化。随后对选中学生依次做表示对齐、跨尺度蒸馏与低秩微调,冻结解码器主干而适配注意力低秩适配器与绑定输出嵌入,并进入下一跳渐进剪枝。在十个公开中英文基准构成的评测套件下,16层模型相对18层基线的宏平均错误率从5.61%降至5.27%。与已有整层删除方法相比,关键差异是用恢复后行为而非静态重要性分数选层,并同时对齐隐藏状态与教师强制及学生策略下的词分布,具有缓解多层非加性交互的实际意义。该结论适用边界受限于Qwen3-ASR单模型族、两跳固定候选与最高一致层数据,跨架构与更广层组合尚未验证。14层模型在车载加速器上编码器延迟降低21.4%而端到端延迟仅降低4.7%,推理开销受自回归解码主导且单次测量未保留运行方差。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


🥉 从认出任务到学出规则:AudioICL-Bench 把音频上下文学习拆成感知与操作两轴

英文题目:AudioICL-Bench: A Benchmark for Large Audio Language Model In-Context Learning

标签:#音频理解 | #基准设计 | #少样本 | #音频大模型 | #基准测试

评分:7.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Jia-Hung Chen:机构信息未在 arXiv HTML 中可靠披露
  • Yi-Cheng Lin:National Taiwan University Taiwan
  • Kai-Wei Chang:Massachusetts Institute of Technology USA
  • Ke-Han Lu:National Taiwan University Taiwan
  • Hung-Yi Lee:NTU AI-CoRE Taiwan

📌 核心摘要

该基准每回合输入为文本指令加k个音频标签演示加待预测查询音频,输出为与当回合重采样隐藏规则一致的标签,难点在于音频无显式单元边界且规则被剥离预训练语义先验而零样本不可解。为此先按回合重采样声学到标签映射与算子语义以保证无演示时接近随机猜测,其输出的不可解回合直接进入下一步的诊断分组。接着把九个任务投影到上下文操作轴与音频能力轴以分离需从演示学什么与需从信号感知什么,分组结果再进入提示对照环节。最后用特定与通用与空指令对照剥离文本提示对规则诱导的贡献,从而把增益归因于演示诱导而非任务识别。与复用固定语义标签的音频上下文学习评测不同,该设计强制模型从演示归纳计数与绑定与多规则组合等新映射而非唤醒旧能力,具有诊断归因意义。在AudioCount任务评测下,5样本条件的准确率为68.3%,高于0样本条件的0.3%。其结论适用边界受限于短时人工合成主导的诊断分布,对真实工厂异常与长时自然语音的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


4. 环境变了就要忘:多通道回放检测的域增量学习基准

英文题目:Domain-Incremental Learning for Multi-Channel Replay Speech Detection

标签:#语音伪造检测 | #持续学习 | #波束成形 | #麦克风阵列 | #基准测试

评分:7.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Michael Neri:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

多通道回放检测的输入为4通道阵列录音的复数短时傅里叶变换,输出为真实语音与扬声器回放的二分类标签,实际难点在于混响与噪声决定的空间线索随声学环境剧烈漂移,顺序微调会灾难性遗忘旧环境。方法链第一步为每个环境实例化独立的可学习波束成形前端,将多通道谱压缩为单通道波束成形谱以抽取环境相关的空间滤波结果。第二步将该单通道谱送入共享卷积循环分类器,在加权交叉熵与正交稀疏正则下输出真伪对数几率,训练新环境时仅优化当前前端与共享分类器而冻结旧前端。第三步在推理时无需环境标签,将已训练全部前端的对数几率取平均后再经softmax得到最终判决。与EWC用Fisher惩罚约束权重漂移、GPM向旧梯度子空间正交补投影不同,该设计把稳定性放在空间前端的结构冻结上,把可塑性留给共享分类器,其实质是以空间特化换取精度而非直接抑制遗忘。在ReMASC的D2阵列评测设置下,TSB的平均错误率AE为23.06±1.14%,低于朴素微调的24.09±1.15%。其结论适用边界受限于固定D2阵列几何下的四环境增量,对跨阵列几何、未知攻击算法与开放场景的外推尚未验证,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


5. 总体学好了不等于每种攻击都学好:高影响攻击的主导与课程缓解

英文题目:Not All Attacks Are Learned Equally in Speech Deepfake Detection

标签:#语音伪造检测 | #课程学习 | #语音 | #鲁棒性

评分:7.7/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前25% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Avantika Singh:机构信息未在 arXiv HTML 中可靠披露
  • Aurosweta Mahapatra:机构信息未在 arXiv HTML 中可靠披露
  • Ismail Rasim Ulgen:Center for Language and Speech Processing (CLSP), Johns Hopkins University, Baltimore
  • Nicholas Andrews:Human Language Technology Center of Excellence (HLT COE), Johns Hopkins University, Baltimore
  • Kong Aik Lee:Hong Kong Polytechnic University
  • Berrak Sisman:Center for Language and Speech Processing (CLSP), Johns Hopkins University, Baltimore

📌 核心摘要

语音深度伪造检测以原始波形为输入并输出真实与伪造二分类标签,难点在于训练集混合多种文本转语音与语音转换攻击而评估使用完全未见攻击,单一整体等错误率会掩盖攻击间的不均衡泛化。作者先构造样本省略与攻击省略共8种训练配置以均衡文本转语音与语音转换暴露,控制攻击组成并测得省略诱发的攻击级等错误率敏感度。接着用训练期攻击级加权交叉熵损失与预测熵刻画优化主导性,识别出低损失集中熵的高影响攻击与高损失弥散熵的低影响攻击。基于该划分提出重放正则化攻击感知课程,先在低影响攻击上预训练建立表示,再以高影响攻击适配并用冻结教师对保留低影响样本做知识蒸馏与约束正则。与已有课程或持续学习方法不同,该方法以测得的攻击影响力而非人工难度或数据到达顺序决定暴露次序,并用双分支重放防止高影响攻击覆盖早期学习。在ASVspoof 2021评测设置下,所提A1+A4课程方法的等错误率为1.48%,低于标准多攻击训练基线的3.04%。该结论适用边界受限于ASVspoof 2019 LA训练加跨库测试的流水线与SLS-XLSR主干,对更新更杂训练分布是否成立尚未验证;原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


6. 希腊语歌声转写:规模放大适配效果,小模型靠翻译正则,大模型靠两阶段专注

英文题目:Automatic Lyric Transcription for Greek Songs: Scaling and Task Composition Effects in Whisper Adaptation

标签:#语音识别 | #SFT | #多任务学习 | #低资源 | #基准测试

评分:7.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Maria Frangiadaki:机构信息未在 arXiv HTML 中可靠披露
  • Dimitrios Damianos:机构信息未在 arXiv HTML 中可靠披露
  • Kosmas Kritsis:机构信息未在 arXiv HTML 中可靠披露
  • Vassilis Katsouros:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

希腊语自动歌词转写需将含伴奏的歌声输入转为希腊语文本输出,难点在于大音高起伏、元音延长与装饰音、节奏不规则及伴奏干扰,导致朗读语音训练的模型严重失配。作者先用混合变换器人声分离模型提取人声并下混为单声道重采样至16kHz,以抑制伴奏并适配Whisper输入,其输出进入下一步切分。接着用定制版连通时间分类强制对齐器在重叠窗上切分并以对齐占比与置信度过滤低质片段,保留的对齐歌声连同生成的英译构成训练验证测试划分。然后在Whisper多尺度上对比转写单任务微调、按固定比例交错的转写加翻译多任务训练,以及先冻结编码器做希腊朗读语音适配再全量解冻做歌唱适配的两阶段策略。相对已有英语自动歌词转写工作,关键差异是面向低资源希腊语建立规模与转写翻译配比可控对照,揭示翻译多任务仅对小容量模型起正则作用而大模型更宜专注转写,具有容量指导意义。在GAD-ALT希腊语歌唱测试集下,两阶段适配的Whisper Large-v3的WER为27.2%,低于同模型零样本基线的53.6%。该结论适用边界限于经人声分离的短片段希腊流行歌曲场景,对现场演唱、合唱及强伴奏残留等条件尚未验证,仍存在语义替换与边界漂移等失败条件。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


7. 先听片段再分流:用文本可答性把死记训练和听觉强化分开

英文题目:SEAR: Segment-Evidence-Aware Routing for Weak-to-Strong Multilingual Speech MCQ

标签:#音频问答 | #强化学习 | #课程学习 | #多语言 | #语音

评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Huy Hoang Le:机构信息未在 arXiv HTML 中可靠披露
  • Long-Bao Nguyen:机构信息未在 arXiv HTML 中可靠披露
  • Minh Tri Dao:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

多语言双人会话语音多项选择问答以长对话音频与题干选项为输入并选出唯一正确选项,难点在于强文本先验可不听音频作答而虚高准确率且问题同时考查内容与发音情感等声学线索。方法先将带时间戳自动转写交由大语言模型切分为自包含会话事件并加可变边界裕量裁剪波形且将时间戳重基至片段起点,为后续生成提供对齐证据。接着语义分支依转写生成内容题而声学分支依波形生成感知题,再经结构接地一致性校验与目标模型可训练性探针筛选得到覆盖21个语言变体的359,825条验证题目。随后无音频探针将仅用文本答对者判为弱样本送入监督微调适配指令格式,答错者判为强样本送入组序列策略优化。与已有方法同等对待全量样本不同,该路由将文本可解监督与音频依赖强化解耦,并以去偏优势与序列级截断重要性校正及动态过滤零方差组稳定混合专家模型训练。在MLC-SLM Task2开发集评测下,SEAR系统的准确率为96.02%,高于同基座零-shot基线的92.40%。该结论适用边界受限于挑战赛会话领域与四选一格式,跨领域与开放式问答尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


8. 同一模型分饰两角:用提示切换为人听与为识别两种增强输出

英文题目:Downstream-Task-Aware Unified Source Separation

标签:#语音增强 | #提示学习 | #语音识别 | #多任务学习

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yoshiki Mitsui:机构信息未在 arXiv HTML 中可靠披露
  • Ryo Aihara:机构信息未在 arXiv HTML 中可靠披露
  • Tatsuhiko Saito:机构信息未在 arXiv HTML 中可靠披露
  • Yoshiki Masuyama:机构信息未在 arXiv HTML 中可靠披露
  • Christoph Boeddeker:机构信息未在 arXiv HTML 中可靠披露
  • Julius Richter:机构信息未在 arXiv HTML 中可靠披露
  • Gordon Wichern:机构信息未在 arXiv HTML 中可靠披露
  • Jonathan Le Roux:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

单通道带噪混合语音增强需同时服务人耳听感与自动语音识别(Automatic Speech Recognition,ASR),而激进降噪在提升波形信噪比时易引入失真并损害识别鲁棒性,这是统一分离模型尚未兼顾的实际难点。方法链分三步推进:带切分编码器先将混合频谱映射为中间张量并拼接可学习提示向量,为条件控制提供表征基础。跨提示模块接着联合建模多提示依赖并输出提示调制后的张量,该输出直接进入目标源提取(Target Source Extraction,TSE)模块以精炼为各源分离特征。带切分解码器与逆短时傅里叶变换最后将分离特征重建为波形,而训练时按提示切换损失,标准提示用信噪比(Signal-to-Noise Ratio,SNR)损失而ASR专用提示用正则化SNR损失。相对已有任务统一源分离的关键机制差异在于新增源条件提示与任务专用提示及混响控制提示,使单模型在推理时仅切换提示即可输出高质量或ASR稳健型等不同特性信号,避免为每种需求单独部署模型的实际意义。在LibriSpeech与ATR噪声的18340条混合评测下,联合训练源条件分支A3-A在4类难噪声上的词错率(Word Error Rate,WER)为19.9%,低于标准分支A1的21.5%。该结论适用边界受限于Whisper-turbo评测与模拟房间脉冲响应混响实验,尚未验证流式部署与其他识别后端的迁移性,原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


9. 机器在打电话:先数录音重放,再问合成语音占多少

英文题目:The Machines Are Calling: Measuring Automated and Synthetic Voices in Unwanted Inbound Calls

标签:#语音伪造检测 | #人类参与评测 | #音频指纹 | #统计分析 | #语音

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Xingyu Shen:Scam AI (Reality Inc.)
  • Tommy Duong:Scam AI (Reality Inc.)
  • Muduo Xu:Scam AI (Reality Inc.)
  • Xiaodong An:Scam AI (Reality Inc.)
  • Jiaqi Gan:Scam AI (Reality Inc.)
  • Haoyuan Tang:Scam AI (Reality Inc.)
  • Jamey Z. Liang:Scam AI (Reality Inc.)
  • Siyu Zhang:Scam AI (Reality Inc.)
  • Yan Zhang:Scam AI (Reality Inc.)
  • Simiao Ren:Scam AI (Reality Inc.)

📌 核心摘要

本研究测量进入交互式语音蜜罐的不受欢迎来电中有多少以机器语音开口,并区分跨呼叫重播录音与当次新鲜合成,输入是主叫独立声道开口前十秒音频,输出是重播、合成、人类、沉默与不可评分类别,实际难点是窄带电话信道导致商用合成检测器域偏移且人耳听辨一致性很低。方法链分三步衔接:先用梅尔倒谱互相关音频指纹做全量两两比对并按相似度连通成重播组,输出重播与新鲜音频划分;再对新鲜音频用商用合成语音检测器打分筛查,输出疑似合成队列;最后将疑似队列送盲听者复核并估计检测器精确率,避免直接把检测分数当作流行率。相对被动蜜罐与混合录音报告的关键机制差异是独立声道保留沉默呼叫作为分母、指纹与检测器分离录音播放污染、以及盲听只报精确率不报流行率,其实质意义是给出可复核的机器语音构成下界。在按接收号码曝光年龄划分的语料条件下,曝光六周后号码的合成占比指标为60.7%,从首周的15.2%升至60.7%。结论适用边界限于已播种诱饵号码收到的线索生成流量开口窗口,跨运营商与全网外推尚未验证,且长曝光号码依赖单一线路存在老化混杂。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


10. 听起来流利不等于可复用:三位朗读者的中库尔德语语音合成核查

英文题目:Assessing the Reusability of Public Speech Resources for Low-Resource Languages: A Central Kurdish Case Study

标签:#文本到语音 | #主观评测 | #低资源 | #模型评估 | #语音

评分:7.1/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Hiwa Asadpour:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文审计中央库尔德语三说话人朗读语料上微调的F5-TTS单说话人合成,输入为阿拉伯字母书写的中央库尔德语文本,输出为对应说话人朗读风格语音,难点在于多书写标准并存、音位归一缺乏可验证依据与公共资源稀缺。复核链条分四步:对照LREC2026论文确认微调起点与词表说明,检查仓库配置与推理脚本暴露模板残留与占位缺陷,再重算主观评测口径并揭示识别器既转写训练文本又评分合成的基线污染,最后追踪许可与发音归一对跨变体复用的约束,前步发现作为后步核验对象进入下一环节。与已有低资源合成报告相比,本文不比模型得分高低,而把可复用性拆为制品可检查性,指出流利感来自朗读域与规则归一的双重窄化。在88名听众共3101条评分的主观评测下,女性有声书合成系统的MOS为4.08,高于录音室男性系统的4.06。结论的适用边界仅限中央库尔德语朗读体单说话人合成,不支持向Badini或Hawrami等变体及自发语域外推,尚未验证多说话人建模下的稳定性。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


11. 不用人工偏好标注:用大音频语言模型反馈做连续自回归非言语发声的偏好优化

英文题目:Preference Optimization with LALM Feedback for Continuous Autoregressive Non-Verbal Vocalization Generation

标签:#文本到语音 | #偏好优化 | #流匹配 | #多语言

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jingbin Hu:机构信息未在 arXiv HTML 中可靠披露
  • Qirui Zhan:机构信息未在 arXiv HTML 中可靠披露
  • Yuang Cao:机构信息未在 arXiv HTML 中可靠披露
  • Ziyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Yunxiang Chen:机构信息未在 arXiv HTML 中可靠披露
  • Houdun Liu:机构信息未在 arXiv HTML 中可靠披露
  • Shuo Feng:机构信息未在 arXiv HTML 中可靠披露
  • Bengu Wu:机构信息未在 arXiv HTML 中可靠披露
  • Lei Xie:机构信息未在 arXiv HTML 中可靠披露
  • Liumeng Xue:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

可控非言语发声(Non-Verbal Vocalization,NVV)生成要求由携带显式发声标签的文本提示合成包含笑声、叹息、呼吸、哭泣等事件的语音,难点在于文本语义与标签冲突时仍要保证发声类型准确、感知显著,且不损伤自然度与整体质量。方法链分三步衔接:双源提示构建混合冲突注入与语义对齐文本以暴露可控失效并覆盖自然场景,随机多候选生成与大音频语言模型(Large Audio-Language Model,LALM)多维打分排序为同提示选出最优与最差配对,拒绝采样微调(Rejection Sampling Fine-Tuning,RSFT)先拟合优选样本实现冷启动,随后锚定流式直接偏好优化(Anchored Flow-DPO)以话语级流匹配损失替代似然做相对偏好学习并保留优选拟合锚。与离散直接偏好优化(Direct Preference Optimization,DPO)依赖序列似然比不同,该设计以相对流匹配损失差刻画偏好并用锚项防止仅拉大边际导致的漂移。在官方NVVSpeech挑战赛第二赛道Track 2的1600条中英测试集上,系统最终得分为75.80,较基线73.96提升1.84,主要来自准确率与感知效果改善而质量保持稳定。该结论仅在该赛事评测协议与所用基座下成立,对真实交互泛化与多说话人场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


12. 组末才分人、跨组再加权:eConv-TasNet 压缩跳连的分离改进

英文题目:EConv-TasNet: Efficient Conv-TasNet for Effective Speech Separation

标签:#语音分离 | #CNN | #高效推理 | #语音

评分:7.1/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Pei-Chun Chang:机构信息未在 arXiv HTML 中可靠披露
  • Chuan-Yi Liu:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

单通道语音分离输入单路混合波形需输出各说话人干净波形,难点在于时域掩码估计既要建模长时依赖区分说话人特征,又要控制延迟与算力以适配边缘部署。eConv-TasNet保留编码器-分离器-解码器框架,先由组式早拆分在每个扩张卷积组末端经门控线性单元与逐点卷积直接生成说话人相关组级表示。接着多组特征聚合以指数加权滑动平均按权重衰减系数递归融合历史精炼嵌入与当前组表示,得到跨组渐进精炼的紧凑嵌入。最后该嵌入经激活与逐点卷积估计说话人掩码,作用于编码器混合特征后由解码器重构各说话人波形。与逐单元早拆分或全层求和相比,该链条将分离提前到组粒度并仅保留组末跳连,以更少表示递归复用历史信息,减少了冗余参数与计算。在WSJ0-2mix测试集下,eConv-TasNet的指标SI-SNRi为18.4 dB,高于Conv-TasNet基线的指标SI-SNRi 15.3 dB。该结论适用边界受限于8 kHz双说话人英语干净与加噪混合验证,对极难样本中位增益仅收窄至0.66 dB,且推理开销在第13代英特尔酷睿i5-1335U单线程CPU上实时率因子为0.13,计算量为8.86G乘加运算量,模型参数为3.8M。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


13. 一段话里换情绪又调语速:以后训练如何教会已有 TTS 听懂分段指令

英文题目:Post-Training Zero-Shot TTS for Fine-Grained Emotion and Duration Control via Natural Language

标签:#文本到语音 | #强化学习 | #0 样本 | #后训练 | #知识蒸馏

评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.4/1.5 | 实验充分 1/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Lianru Gao:机构信息未在 arXiv HTML 中可靠披露
  • Yujie Guo:机构信息未在 arXiv HTML 中可靠披露
  • Yong Qin:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为切分为K个片段的文本x、自然语言指令c与参考说话人语音,输出为单条连续语音,要求各片段分别满足指定情感与时长并保持内容与说话人身份,难点在于多局部要求易互相干扰且需精确定位到对应音频区间。方法为多阶段后训练链,仅训练CosyVoice2语音语言模型而冻结分词器、声学生成器与声码器,先用合成情感拼接数据做监督微调建立指令到语音token映射,再用群组相对策略优化以情感奖励强化局部准确性并辅以内容与说话人保持奖励。随后在情感精炼模型上做时长监督微调与时长群组相对策略优化,并混合情感、时长与联合样本做联合精炼以缓解遗忘,前阶段模型作为后阶段初始化进入下一步。最后用指令等价蒸馏以冻结教师在规范指令下生成目标、学生在改写指令下匹配分布来提升措辞鲁棒性,并做短程混合精炼恢复精度,推理时无新增控制模块。与依赖结构化控制信号或推理时转向模块的WeSCon、TED-TTS、MAGIC-TTS不同,该框架直接改造预训练语音语言模型本身,避免专用接口与额外推理流程。在534个请求的英文与中文混合基准下,联合精炼模型的MER严格话语准确率为54.12%,高于CosyVoice2指令基线的3.53%。三重联合严格准确率仅5.29%构成明确失败条件,改写指令下时长严格精度不升反降显示其适用边界受限,词级强调等更细粒度控制的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


14. 盲评多说话人长对话问答:微调记忆、上下文纠偏与语音锚定检索的三条路线

英文题目:The Eloquence submission for Task 2 of the Interspeech 2026 MLC-SLM challenge

标签:#音频问答 | #LoRA | #检索增强 | #多语言 | #语音

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Jordi Luque:机构信息未在 arXiv HTML 中可靠披露
  • Lorenzo Concina:机构信息未在 arXiv HTML 中可靠披露
  • Marco Matassoni:机构信息未在 arXiv HTML 中可靠披露
  • Alessio Brutti:机构信息未在 arXiv HTML 中可靠披露
  • Filippo Vella:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

第二届多语言会话语音语言模型Multilingual Conversational Speech Language Model / MLC-SLM挑战任务2要求直接从原始长会话录音回答探测声学属性与语义内容的多项选择问答Multiple-Choice Question Answering / MCQA,覆盖21种语言,输入为多说话人重叠会话音频加文本题干,输出为单个选项字母,评测时无话者标签、无切分、无真实 diarization。方法链由三条独立路线构成:微调路线以低秩适配Low-Rank Adaptation / LoRA微调Voxtral-Mini-3B并辅以翻译补齐、转写前缀与时间戳裁剪;上下文学习路线以冻结Voxtral-24B加固定多模态示例重塑输出先验;检索路线将长会话一次性注册为声学身份、语义内容与知识图谱三层记忆,再组装事实表交由冻结大语言模型作答。与端到端适配相比,后两者零参数更新,分别矫正位置偏置与解耦感知召回与推理。在9470道题的Phase 2评测上,冻结24B加6个多模态示例达0.81准确率,微调3B为0.72,免训练检索为0.68,均高于0.35的官方基线。该结论限于竞赛盲测划分与Gemini 2.5-Pro生成加人工复核的题型分布,未验证开放域问答与跨会话外推,最终排名第5。原文未披露训练时长、推理延迟与部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


15. 从跳变的数值解到连续的 learned 逆映射:二次差频谱合成如何变得可演奏

英文题目:Learned Continuous Synthesis of Quadratic Difference Tone Spectra

标签:#音乐生成 | #课程学习 | #音乐 | #实时处理 | #开源工具

评分:7.0/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Esteban Gutiérrez:机构信息未在 arXiv HTML 中可靠披露
  • Behzad Haki:机构信息未在 arXiv HTML 中可靠披露
  • Christopher Haworth:机构信息未在 arXiv HTML 中可靠披露
  • Xavier Serra:机构信息未在 arXiv HTML 中可靠披露
  • Rodrigo Cádiz:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

二次差频音频谱合成以目标谐波幅度向量为输入,求解经平方律失真映射后能激发出该幻听的载波复音幅度,难点在于失真映射多对一且部分目标无精确实数解,逐帧随机求根会在时变目标下跳变分支导致可闻断裂。该方法先将非零目标向量归一化为单位球面方向以分离尺度,再用三层感知机学习方向分量的逆映射并乘以范数平方根实现精确齐次缩放,输出直接进入固定解析失真函数构成自编码器式重构损失进行训练。训练从以全0.5为中心半径0.1的小球面采样起步,逐步扩大采样半径至1以先锁定局部单分支再光滑外推,并用多随机初始化筛选连续解。在N为5到16的10000个均匀随机目标评测下,神经求解器的重构误差指标均值保持在0.04以下,高于随机Newton-Raphson基线的对应误差指标。与已有方法相比,关键机制差异是连续性与尺度齐次性由网络结构内生保证而非事后强制,计算量与输入条件无关,因而支持连续音色渐变与时变重合成。该结论适用边界仅限于幅度关系反演与中等以上声压级扬声器聆听,尚未验证立方差频音与个体耳蜗差异下的外推,且相同幅度目标的感知显著受载波相位影响。原文未披露训练成本,推理开销在Apple M4 Pro硬件上单次低于0.25毫秒,满足音频控制速率实时部署。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


16. 不用先分离也能听清目标人:以参考语音作声纹提示的统一识别

英文题目:Xiaomi-CocktailASR-1 Technical Report

标签:#目标说话人提取 | #端到端学习 | #语音 | #大语言模型

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Yiru Zhang:Xiaomi Inc., China
  • Hang Su:Xiaomi Inc., China
  • Lichun Fan:Xiaomi Inc., China
  • Ying Zeng:Xiaomi Inc., China
  • Chang Liu:Xiaomi Inc., China
  • Yifeng Wang:Xiaomi Inc., China
  • Yuquan Liang:Xiaomi Inc., China
  • Tao Li:Xiaomi Inc., China
  • Lian Li:Xiaomi Inc., China
  • Wenhao Yang:Xiaomi Inc., China
  • Jian Luan:Xiaomi Inc., China
  • Cong Zou:Xiaomi Inc., China
  • Heng Qu:Xiaomi Inc., China

📌 核心摘要

针对多人重叠语音中只转写目标说话人的目标说话人识别任务,输入为参考语音加混合语音,输出为目标转写或空文本,难点在于抑制干扰的同时避免单人过抑制与目标缺席误触发。方法链为参考语音、1秒静音与混合语音拼接后送入语音编码器提取融合语义与声纹的帧表示,再经适配器映射至大语言模型语义空间。最后由统一提示分别完成标准转写、空输出拒识或显式推理转写,其中推理模式输出说话人数与声纹相似度等级后再给出转写。与级联式目标说话人提取加识别及外挂说话人编码器方案不同,该设计将声纹提示内化为编码器条件,避免了显式分离与阈值后处理。在LibriSpeechMix 2mix基准下,Xiaomi-CocktailASR-1的TS-WER为2.90%,低于CONF-TSASR的5.40%。单人场景下该模型误拒率低且转写精度接近主流单人模型,兼顾多人与单人识别。该结论适用边界限于中英文会议与合成重叠语音,远场强混响、多语码切换及参考语音极短或失配时的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


17. 时长不只决定贴多少次:用受控微分方程让音素表示随时间演化

英文题目:Continuous-Time Acoustic Modelling with Neural Controlled Differential Equations

标签:#文本到语音 | #状态空间模型 | #语音 | #众包评测

评分:7.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Mattias Cross:Speech and Hearing Group University of Sheffield Sheffield, United Kingdom
  • Minghui Zhao:Speech and Hearing Group University of Sheffield Sheffield, United Kingdom
  • Anton Ragni:Speech and Hearing Group University of Sheffield Sheffield, United Kingdom

📌 核心摘要

情感控制语音合成需由音素序列生成波形或频谱,难点在于同一音素在不同时长、情感强度下声学轨迹并非简单重复,传统长度调节仅改变隐状态出现次数而不改变其取值。本文先由文本编码器输出音素级表示并拼接归一化时长通道构造离散控制序列,再经线性插值形成连续控制路径,接着以神经向量场驱动受控微分方程积分得到连续隐轨迹,最后采样上采样送入StyleTTS 2与Matcha-TTS类解码器合成。与仅做重复上采样的基线相比,该机制让时长通过控制微分直接改变隐状态值,并将时间分辨率暴露为可调建模选择。在ESD英语子集长上下文评测中,单层步长 \(h=1.0\) 的CDE取得宏观Spearman相关0.53,明显高于微调基线的0.08,同时CMOS-EQ utterance级无显著差异。该结论限于5小时情感微调、50句主观测试与特定求解器配置,未验证帧级控制、大规模多说话人或跨语言外推。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


18. 停顿该切还是该连:让日志误差率保留总分并拆出停顿可解释部分

英文题目:Diarization Error Decomposition Under Pause Annotation Ambiguity

标签:#说话人分离标注 | #评测协议 | #形式化分析 | #模型评估

评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Shota Horiguchi:机构信息未在 arXiv HTML 中可靠披露
  • Marc Delcroix:机构信息未在 arXiv HTML 中可靠披露
  • Naohiro Tawara:机构信息未在 arXiv HTML 中可靠披露
  • Alexis Plaquet:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

说话人分离的输入是连续录音,输出是谁在何时说话的时间标注,难点在于短停顿应切分还是填平在不同语料间定义冲突并直接污染时长加权的说话人分离错误率。所提方法先固定说话人映射并枚举单侧内部停顿,明确停顿起止与持续时长为后续判定提供候选。再检验候选停顿是否被对侧连续语音贯穿且满足阈值约束以判定暂停填充相容性,上一步的候选区间直接进入该相容性检验。最后用瞬时漏检与虚警计数取最小值切分出暂停归因误差与剩余核心误差,使两者之和精确等于标准说话人分离错误率而混淆误差保持不变。与对参考或假设做形态学闭运算后再算分不同,该机制不改变错误率总值且保留重叠与片段结构,只改变归因比例并随阈值单调变化至有限饱和。在AMI混合麦克风语料的松标签评测设置下,紧标签训练系统的DER错误率为27.0%,高于混合标注训练基线的DER错误率11.9%。该结论适用边界受限于相同松紧参考下的系统比较,跨不同松紧参考的核心误差不可直接比较,且其紧边界外推与主动学习价值尚未验证,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


19. 把幻觉拆成可验的原子断言:OmniHallu 统一六向跨模态检测

英文题目:OmniHallu: Unified Hallucination Detection for Cross-Modal Comprehension and Generation in Multimodal Large Language Models

标签:#音频字幕生成 | #偏好优化 | #基准测试 | #模型评估 | #多模态模型

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Jianjiang Yang:The University of Manchester
  • Peihang Li:The University of Hong Kong
  • Shanqing Xu:Huazhong University of Science and Technology
  • Mengchen Qian:Huazhong University of Science and Technology
  • Lu Zhang:Shanghai Academy of Educational Sciences
  • Meng Luo:National University of Singapore

📌 核心摘要

多模态大语言模型需同时处理图像视频音频到文本的理解与文本到图像视频音频的生成,输出幻觉表现为与输入语义矛盾或无支撑的声明,难点在于时序因果、声学线索与组合关系的验证工具成熟度差异极大。方法链第一步由原子声明分解将长输出拆为可验证原子句并经自反思校验语义保真。第二步将原子句送入模态专用专家验证,图像用开放集检测器与大模型集成判属性关系事件,视频将声明转问答做帧级取证,音频由三专家投票并以等权多数汇总证据。第三步由推理聚合器综合各专家判断、证据与置信信号输出标签与解释,而经偏好优化训练的轻量验证器以高置信直判、低置信回退全流水线实现前置过滤。相对仅适用图像的单模态自检流水线,差异在于统一声明协议加模态专用取证与可调成本的混合调用,意义在于跨六任务复用同一判定语义。在OmniHallu-Bench基准下,本框架在图像到文本任务的Mac.F1为82.95,高于GPT-4.1 UNIHD基线的78.88。结论适用边界受限于以文本为中心的四类幻觉划分与现有专家能力,关系型幻觉最难且视频长程推理与音频源分离仍是主要失败条件。全量流水线单样本推理开销约为15秒与约0.12美元,过滤后延迟降至约6秒与约0.05美元。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


20. 编码器与解码器更新差十倍时,按参数量分配的差分隐私裁剪为何崩溃

英文题目:Component-Aware Differential Privacy for Federated Multilingual Speech-LLMs

标签:#语音识别 | #联邦学习 | #隐私保护 | #多语言

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jordi Luque:机构信息未在 arXiv HTML 中可靠披露
  • Fernando López:机构信息未在 arXiv HTML 中可靠披露
  • Aleix Sant:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理联邦多语言语音识别中的差分隐私微调,输入为分散在说话人客户端的语音,输出为转写文本,难点是声学编码器与语言解码器更新范数相差一个数量级时单池预算被大范数组件吞噬。方法链分三步:先在无隐私与扁平裁剪下刻画各低秩矩阵范数与信噪比,定位跨组件预算坍缩;再引入基于指数滑动平均的自适应单池分配以跟踪层范数变化;最后提出 \(\alpha\)-split 双池设计,将编码器与解码器加连接器解耦裁剪并保持联合敏感度不变。与已有尺寸成比例单池方法的差异在于把平方预算按组件隔离,避免参数量大但单矩阵范数小的编码器稀释解码器预算。在 Multilingual LibriSpeech 测试集 19492 条样本、40 轮联邦、每轮约 94 客户端、\(C=1.0\) 且噪声乘子为 0.1 的设置下,Whisper 加 TinyLlama 非冻结组该方法词错率为 0.1986,接近扁平裁剪上限 0.1959,同时编码器获得 4.47 倍更紧的组件级有效保护而解码器开销仅为 2.6%。结论仅适用于编码器与解码器严重失衡的拼接式语音大模型,在范数比约 1.7 倍的 Voxtral 端到端模型上固定切分反而有害。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


21. 从波形到可弹指法:TART 如何把音高、技巧与弦品分四步拼成谱

英文题目:TART: A Modular Tool for Technique-Aware Audio-to-Tablature Guitar Transcription

标签:#音乐转录 | #Transformer | #音乐 | #0 样本

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Akshaj Gupta:机构信息未在 arXiv HTML 中可靠披露
  • Hwi Joo Park:机构信息未在 arXiv HTML 中可靠披露
  • Andrea Guzman:机构信息未在 arXiv HTML 中可靠披露
  • Shamak Gowda:机构信息未在 arXiv HTML 中可靠披露
  • Samhita Konduri:机构信息未在 arXiv HTML 中可靠披露
  • Jiachen Lian:机构信息未在 arXiv HTML 中可靠披露
  • Robin Netzorg:机构信息未在 arXiv HTML 中可靠披露
  • Gopala Anumanchipalli:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

吉他音频到指板谱转录需将原始波形映射为带弦品位置与演奏技法的可演奏谱面,难点在于表现技法多样、同一音高对应多组弦品以及真实录音噪声严重。TART以四阶段流水线处理该任务:高分辨率卷积循环网络将音频转为带起止时间的音符序列,时序卷积双向长短时记忆网络为每个音符标注九类技法,音频条件化T5编码器解码器结合音符符号与音色线索分配弦品并经束搜索约束保证可弹奏性,最后用节拍估计与量化渲染为MusicXML谱面。与纯符号指法模型不同,该方法在编码器前拼接基于起音的频谱嵌入,使自注意力可利用弦径与泛音差异区分同音异弦。四个零样本基准平均结果显示音频到MIDI的F50达到81.35%,相对最强基线提升6.67个百分点,预言MIDI下弦品Tab F1达到71.8%,相对原Fretting-Transformer提升8.5个百分点,端到端Tab F1为54.08%。该结论仅适用于标准六弦吉他独奏与所测数据集分布,对无音高打击乐、多技法叠加与复杂节奏量化仍会失效。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


22. 以文本为锚、让停顿和拖长显形:LAPE 如何统一转写与融合做阿尔茨海默语音检测

英文题目:LLM-Anchored Paralinguistic Enrichment for Alzheimer’s Disease Detection

标签:#病理语音评估 | #多模态学习 | #语音 | #大语言模型 | #语音生物标志物

评分:6.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Xiao Wei:机构信息未在 arXiv HTML 中可靠披露
  • Yuqin Lin:机构信息未在 arXiv HTML 中可靠披露
  • Yaru Cao:机构信息未在 arXiv HTML 中可靠披露
  • Jinyu Li:机构信息未在 arXiv HTML 中可靠披露
  • Bin Wen:机构信息未在 arXiv HTML 中可靠披露
  • Kai Li:机构信息未在 arXiv HTML 中可靠披露
  • Yueying Chen:机构信息未在 arXiv HTML 中可靠披露
  • Longbiao Wang:机构信息未在 arXiv HTML 中可靠披露
  • Jianwu Dang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

面向Cookie Theft图片描述语音的阿尔茨海默病检测需以单条录音判别患者与健康对照,难点在于纯文本丢失停顿与拖长等时序事件且文本与语音判别贡献不对称。韵律事件文本化先按词时间戳计算词间停顿与音节条件下的词内拖长,并以专用暂停与拖长标记的有界重复显式写入转录,再送入冻结Kimi模型联合建模词汇与事件。词汇韵律单元化与分块以上一步增广转录为骨架,将语言子词状态与Whisper帧状态按词与标记单元对齐,仅对连续词单元做均值池化而保留每个暂停、拖长与边界单元的身份与强度。文本锚定融合以文本块为锚,对局部语音块与话语级语音块做归一化并由NormGate动态门控缩放后拼接,再经三层感知机分类。与把停顿映射为逗号句号的标点方案和无界重复方案的关键差异在于专用标记隔离句法功能且有界重复保留事件强度,避免时序证据被分词或粗粒度池化稀释。在ADReSSo留一被试评测设置下,LAPE的准确率为91.57%,高于CogniAlign的87.35%。该结论适用边界受限于两套英语Cookie Theft语料官方训练集内被试级交叉验证与留一评估的受控录音加离线对齐条件,尚未验证官方测试集、跨语言自发对话与噪声远场场景。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


23. 情绪幻觉为何分面而治:从六维评估到记忆引导的生成校正

英文题目:Multi-Faceted Evaluation and Mitigation of Emotion Hallucinations in MLLMs

标签:#语音情感识别 | #评测协议 | #测试时自适应 | #模型评估 | #音视频

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Bowen Zeng:机构信息未在 arXiv HTML 中可靠披露
  • Peipei Song:机构信息未在 arXiv HTML 中可靠披露
  • Weidong Chen:机构信息未在 arXiv HTML 中可靠披露
  • Shengeng Tang:机构信息未在 arXiv HTML 中可靠披露
  • Song Ye:机构信息未在 arXiv HTML 中可靠披露
  • Yuanhong Zhong:机构信息未在 arXiv HTML 中可靠披露
  • Beier Zhu:机构信息未在 arXiv HTML 中可靠披露
  • Xun Yang:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

开放式情绪推理需从视频、音频与文本生成自由文本解释,难点在于情绪线索隐式且推理链长,对象级幻觉指标与封闭问答无法覆盖多面错误。EHR评估器先将生成拆成可验证声明并映射到表情、动作、音频、直觉、逻辑与结论六个切面,再由法官模型给出支撑与否标签并定位幻觉词元跨度以计算切面幻觉率。HMER以幻觉记忆累积幻觉跨度的全词表分布方向,用目标对数修正抑制与幻觉方向相关且当前上下文高概率的词表项,重塑下一轮解码轨迹。同时锚记忆只收录每句修正候选中幻觉率最低的可信句子作为后续自回归上下文,阻断被拒候选的错误历史进入后续推理。与粗粒度对比解码只做全局压制不同,HMER用词表级抑制方向做目标修正并用可信锚点做轨迹级隔离,因而能同时降低感知与推理幻觉而不牺牲流畅性。在OV-MERD+零样本开放式情绪推理评测设置下,HMER方法的总体幻觉率指标EHRtotal为23.52%,低于AffectGPT基线的32.43%。该结论适用边界受限于三个情绪推理数据集与三类基座的零样本生成场景,依赖自动评测与人工高度一致假设,对长尾情绪与强遮挡多模态冲突的外推尚未验证。推理开销随最大修正轮数增长,K为3时单样本延迟已达157.44秒,输入输出词元与延迟同步上升,需以早停控制实际成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


24. 遗忘主要发生在分类头:同分布声音分类中冻住特征只调动态头的对比

英文题目:Investigating catastrophic forgetting in sound event classification

标签:#音频分类 | #持续学习 | #知识蒸馏 | #环境声

评分:6.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Riccardo Casciotti:机构信息未在 arXiv HTML 中可靠披露
  • Annamaria Mesaros:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文研究多标签声音事件分类中的类别增量学习,输入为统一至10秒的对数梅尔频谱,输出为全部已见类别的多标签存在概率,难点在于新旧类别声学模式重叠且无法访问旧数据时新训练极易干扰旧决策边界。方法链分四步:首先以动态分类头随任务扩张输出单元以容纳新类并保留旧类输出;其次以前一模型为教师用知识蒸馏软输出约束新模型以保留旧映射;再次基于免数据剪枝重要性评分排序卷积核并冻结重要核以引导更新至次要核;最后在首任务后完全冻结特征提取器与批归一化层而仅微调分类头。上一步的头扩张与旧模型保存为下一步蒸馏与核保护提供结构与参照,使表示保护与输出扩展衔接。与核级可塑性调制相比,冻结微调不再精细分配表示层可塑性,而是承认同域声学表示可复用并把抗干扰集中到输出层,具有实现简单与训练稳定的实际意义。在AudioSet非排序任务下,finetune的BWT指标为-0.5,高于kld的-3.5。结论适用边界限于同域且首任务含30类的音频分类增量,对跨域漂移、少样本新类与单遍在线学习尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


25. 少即是多:轮次结束主要靠声音和韵律,而非文本语义

英文题目:Less can be More: What Aspects of Speech Drive End-of-Turn Detection

标签:#轮次切换 | #多模态学习 | #流式处理 | #语音 | #模型比较

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Rini Sharon:机构信息未在 arXiv HTML 中可靠披露
  • Manickavela A:机构信息未在 arXiv HTML 中可靠披露
  • Kadri Hacioglu:机构信息未在 arXiv HTML 中可靠披露
  • Andreas Stolcke:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

轮次结束检测需对流式语音逐帧输出结束概率,既不能在犹豫停顿处过早打断,也不能在真边界后拖延响应。该方法先并行抽取三路信号:冻结Zipformer2编码器从对数梅尔谱提取声学表征,手工算法从波形提取归一化基频、基频变化与停顿累积等五维韵律特征,冻结RNN-T贪婪解码加MiniLM句嵌入提取语义表征并在空白帧缓存复用。随后各支路经独立投影与七帧因果深度可分离时序卷积统一到25Hz帧率,使声学、韵律与文本表示在时间上对齐并带上280ms因果上下文。最后三路表示拼接为272维向量,经线性降维与单维映射加Sigmoid输出每帧结束概率,并以持续八帧超阈值规则判定检测时刻,禁用模态以零向量占位并阻断梯度保证七个子集同维度同参可比。与以往直接比较强单模态与多模态系统不同,该机制差异在于用零掩码保持输入维度与参数量不变并独立重训全部非空子集,使性能差只反映信号有无而非容量变化,其实测意义是揭示文本连续融合的结构性误报代价。在5000条测试集评测下,声学加韵律组合的F1为0.930,高于声学单模态的0.927。该结论适用边界受限于英文双人电话对话与10-11s长轮次分布,噪声、低资源语言或干净预切分语料下文本价值尚未验证。文本支路虽使中位延迟降至360ms,但带来30-60ms的RNN-T/BERT推理开销,部署时需权衡延迟收益与计算负担。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


26. 野外视频多语转写为何开箱约三成错误:Whisper 与 WhisperX 的可复用流水线

英文题目:Whisper-Based Speech Transcription from Videos Across Multiple Languages for Cross-Cultural Understanding

标签:#语音识别 | #SFT | #多语言 | #语音 | #数据集

评分:6.5/10 | 创新 1/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Michael Picheny:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文面向跨文化理解处理野外多语言视频语音转写,输入为YouTube长视频音频,输出为可供大语言模型抽取文化标记的文本与说话人分段,难点在于自然口语噪声大、低资源语言数据少且非语音专家难以自建系统。方法先基于Jtubespeech与yt-dlp按字幕类型和许可筛选视频并统一重采样得到可训练音频,其输出进入切分环节。接着将闭路字幕合并为20秒或静音分隔长段并用WhisperX对齐模型校正词级时间戳,形成可计算词错率的训练开发测试切分。最后以Whisper与WhisperX开箱解码并用小量人工字幕做监督微调,其转写直接用于下游文化分析。与直接调用基座模型相比,关键差异在于引入语音活动检测更强的WhisperX切分与生成长度约束来抑制幻觉,从而减少插入错误并提升可用性。在七语种YouTube视频评测下,全量微调后系统的平均转写错误率为20%,低于开箱基线的30%。该结论适用边界受限于有人工字幕可作弱监督的视频域,尚未验证对无字幕野外数据和下游文化标记抽取的实际增益,原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


27. 边听边想错了怎么办:RetroThinker 让语音大模型向前改错

英文题目:RetroThinker: Enabling Retrospective Thinking in Speech LLMs

标签:#音频问答 | #SFT | #语音 | #流式处理 | #高效推理

评分:6.5/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yi-Jen Shih:机构信息未在 arXiv HTML 中可靠披露
  • Puyuan Peng:机构信息未在 arXiv HTML 中可靠披露
  • Abdelrahman Mohamed:机构信息未在 arXiv HTML 中可靠披露
  • David Harwath:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

输入为流式用户语音提问,输出为同步系统语音回答,难点是语音大语言模型推理弱于同规模文本模型,且思维链(Chain-of-Thought,CoT)会增加首包延迟。RetroThinker基于Moshi构建三阶段后训练:阶段一用规则扰动合成错误步骤做监督微调(Supervised Fine-Tuning,SFT)建立验证与纠错格式,阶段二用阶段一模型采样真实错误并由外部大模型裁判改写以对齐真实失败分布,阶段三在不完整输入下做长度偏好优化以压缩冗余回溯并适配早期推理(Early Reasoning)。与视觉字幕回溯依赖回滚重生成不同,关键差异是保留错误历史的前向修正,用后续正确步骤覆盖而非删除错误,全程不中断音频流。前向修正与边听边想结合后,在TTS合成的GSM8K语音评测下,早期推理加回溯加直接偏好优化(Direct Preference Optimization,DPO)在问题完整度(Question Completeness,QC)阈值95%时相对标准推理基线在相近延迟下取得11个百分点的绝对准确率提升。结论仅适用于受控多步数学语音问答,未验证自然对话中的中断、口吃、噪声与开放域任务。原文未披露训练、推理与部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


28. 计时稳定、内容易偏:法语全双工基准如何分离两种能力

英文题目:From Metrics to Natural Dialogue: French Full-Duplex Benchmark for Spoken Dialogue Models

标签:#全双工语音交互 | #基准设计 | #基准测试 | #多语言

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Hamid Soltani:Luqia Technologies, Montréal, Québec, Canada
  • Gilles Boulianne:Luqia Technologies, Montréal, Québec, Canada

📌 核心摘要

全双工语音对话要求模型在持续双通道语音流中同时监听与发声,输入为对话音频片段,输出为是否接管、反馈时机与回应内容,难点在于时序决策与语义理解耦合且法语非正式重叠与韵律线索缺失。该工作先针对CALLFRIEND与MEDIA差异做语料相关转写与对齐以获得词级时间戳,其输出进入按2.0秒聚轮再按0.2秒词间隔切分句子的轮次抽取。切分后的配对轮次进入按停顿、反向通道、平滑轮换与用户打断四类事件的候选抽取,下一步按理想暂停时长与轮间隙等质量分过滤排序。排序靠前候选被截取音频并按FDB目录格式物化导出为CALLFC-FDB与MEDIA-FDB,再用英法级联与端到端模型及人类对话做交叉评测。相对已有合成语音为主的FDB,关键差异在于保留真实电话与任务型人机对话的重叠与韵律并引入人类表现作为自然度锚点,使时序指标与内容质量可分离解读。在MEDIA-FDB用户打断任务评测设置下,法语级联系统的Rating得分为3.471,高于英语级联系统的0.486。其结论适用边界是仅覆盖FDB v1.0单事件任务,尚未验证重叠语音与多轮长程连贯且语料领域差异干扰语言效应分离而受限。推理开销上原文披露级联系统在NVIDIA A40上延迟达7-8秒且主要来自LLM生成,STT与TTS延迟较小。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


29. 标注起点系统性偏早时,如何量出语音检测的真实反应速度

英文题目:Low-Latency State Space Voice Activity Detection with Robust Onset Time Evaluation

标签:#语音活动检测 | #状态空间模型 | #流式处理 | #评测协议

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Elad Cohen:机构信息未在 arXiv HTML 中可靠披露
  • Arnon Netzer:机构信息未在 arXiv HTML 中可靠披露
  • Hai Victor Habi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音活动检测需从含噪音频逐帧输出语音概率,低时延流式应用还要求精确度量语音起始响应,但标注存在数十至数百毫秒系统性早标与抖动使朴素时延失真。该方法先以参考VAD在标注起始附近窗口内构建局部起始似然作为弱观测,将标注时刻建模为真实起始的含噪观测。接着用期望最大化在全量数据上估计标注噪声分布并取其均值校正朴素起始偏差,再与硬件耗时相加得到起始延迟,窗口内参考误差被平均而锚定真实事件。然后提出对角结构化状态空间S4VAD,以可控记忆衰减的线性递推在卷积并行训练与递推流式推理间等价切换,兼顾长程上下文与局部快速响应。在LibriSpeech测试集评估设置下,S4VAD的Onset Bias指标为39 ms,低于MarbleNet的Onset Bias的54 ms。相对卷积、Transformer与循环基线,该可解释时间常数机制使其更快跨越持续激活门限而无需牺牲过多分类性能。上述结论适用边界受限于单次起始与持续激活短窗评估,尚未验证重叠语音与极低信噪比外推性,原文在苹果M4 Max硬件上测得S4VAD硬件延迟为0.3 ms。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


30. 总词错率相同,切换处却不同:英语-约鲁巴语码切换转写的边界失效

英文题目:Beyond Word Error Rate: A Switch Aware Evaluation of ASR and Audio Language Models on English Yoruba Code-Switched Speech

标签:#语音识别 | #基准设计 | #多语言 | #低资源 | #基准测试

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Chibuzor Okocha:机构信息未在 arXiv HTML 中可靠披露
  • Christan Earl Grant:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文处理英语主导的英语-约鲁巴语码切换短语音逐字转写,输入平均4.20秒、8.52词且平均2.60次切换,输出需保留ẹ、ọ、ṣ下点与声调变音符号,难点是整体WER被高识别率英语矩阵语言主导而稀释嵌入语切换点失效。首先在AfriCodeSwitch验证集上固定确定性2000条cap2000清单并统一Unicode NFC归一化、大小写折叠与标点剥离,为对齐提供同一输入。其次用最小编辑距离对齐判定每词正确与否并结合语料语言标签划分语言归属与切换入口集合,将上步对齐输出转为掩膜位置集。然后在这些位置集上并行计算整体误差、英语/约鲁巴语特异误差、切换入口与窗口误差及去变音WER,并以1000次utterance级配对自助法检验排序差异,使诊断直接承接掩膜定义。与按语言成员加总的MER和只评嵌入语的PIER不同,本工作把评分锚定到语言游程首词元及其邻域,从而分离矩阵语言准确率与切换保真度。在cap2000共享清单评测设置下,Kimi-Audio-7B-Instruct的SETER错误率为66.8%,低于Parakeet-TDT-0.6B-v2的SETER错误率68.9%。结论适用边界限于单语料零样本转写,尚未验证其他方言、自发对话与训练改进,且原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


31. 语音编码器里也有极小电路:联合找权重与边并把显存从四次降到三次

英文题目:Sparse Weight and Edge Circuit Discovery in Transformer-based Acoustic Models

标签:#音频分类 | #模型剪枝 | #可解释性 | #语音

评分:6.2/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Jiankun Wei:Department of Computer Science University of Toronto Toronto, Canada 0009-0006-4926-3815
  • Ewan Dunbar:Department of Computer Science University of Toronto Toronto, Canada 0000-0001-9603-953X
  • Gerald Penn:Department of Computer Science University of Toronto Toronto, Canada 0000-0003-3553-8305

📌 核心摘要

语音编码器需将波形映射为可供元音辅音清浊关键词情感与伪造检测等分类输出的表示,但其内部经堆叠Transformer块与残差流传递而不暴露自回归词元,故难以定位任务相关计算子图。该工作冻结HuBERT与Wav2Vec2.0并接入单层前馈分类头,先以Gumbel-Sigmoid加直通估计联合学习权重掩码与边掩码,得到稀疏子网络候选。接着以保真度互补均匀性与稀疏性加权目标筛选最小功能路径,再截断早期残差仅保留近端块,使边搜索内存从四次降至三次。与仅做权重剪枝或文本解码器电路方法不同,该机制同时约束参数子集与残差流信息边,因而能直接检验预训练表示是否被使用而非仅可被探针解码。在ASVspoof2019伪造检测任务下,微调基线的准确率为99.9%,高于冻结基线的97.6%。结论适用边界受限于两个英语编码器与六类分类任务,回归跨语言与其他架构的外推尚未验证,且层间稀疏递增成因亦未解释。在硬件方面,原文指出启用边发现时HuBERT等模型无法在48GB的NVIDIA L4上承载,而截断QKV残差后可在该硬件上运行全量发现流程。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


32. 只会说还不够:复杂文本如何暴露低资源多语语音合成的系统性失效

英文题目:Complex-Text Robustness Evaluation and Failure Diagnosis for Low-Resource Multilingual Text-to-Speech

标签:#文本到语音 | #评测协议 | #多语言 | #低资源 | #鲁棒性

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Tianlun Zuo:机构信息未在 arXiv HTML 中可靠披露
  • Ziyu Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Tingzhi Mao:机构信息未在 arXiv HTML 中可靠披露
  • Zhonghua Fu:机构信息未在 arXiv HTML 中可靠披露
  • Lei Xie:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

低资源多语言文本到语音需将泰语、越南语、斯瓦希里语和印度尼西亚语等正字法差异显著的书面文本转换为目标语言语音,难点在于数字日期口语化、命名实体发音、混合语种语言控制与长文本稳定性问题在前端归一化资源匮乏时集中暴露。该工作构建四阶段诊断链,先按普通句与数字日期、命名实体、长句、混合语种及标点结构六类风险文本构造可比测试集,再用同一输入驱动OmniVoice、VoxCPM2和MMS-TTS三个多语言系统生成语音以保证公平比较。接着以统一多语言识别与时长工具输出字符错误率、语言识别准确率和时长异常率三维指标,分别对应内容一致性、语言一致性和生成稳定性,最后结合文本风险分与人工抽查将异常归因至省略、重复、截断、语言混淆与口语化错误等失败模式。相对只测短句自然度与平均质量的已有评测,其关键差异在于把输入端可观测的文本复杂度显式建模为无需训练的先验风险分,并与输出端内容、语言和时长异常对齐,从而实现合成前的低成本风险预警与前端优化指导。在多语言复杂文本评测设置下,数字日期类样本的字符错误率为23.40%,高于混合语种样本的17.77%。该结论适用边界限于所选四语与三系统在受控模板文本下的相对比较,跨语言、跨系统与真实长尾文本的外推尚未验证,且自动识别与语言判别工具自身误差可能干扰语言级结论。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


33. 用可解释的发音动作比较口音:构音特征对齐与最优传输如何替代黑盒嵌入

英文题目:Flexible and Interpretable Accent Distance Measurements

标签:#语言识别 | #统计分析 | #可解释性 | #语音 | #社会语音学

评分:6.1/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Charles McGhee:机构信息未在 arXiv HTML 中可靠披露
  • Mark J. F. Gales:机构信息未在 arXiv HTML 中可靠披露
  • Kate M. Knill:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

口音比较的输入是两个说话人的任意录音,输出是全局口音距离与可定位的发音差异,难点是在无配对文本时剥离说话人音色与信道并保留可解释性。该工作先用声学到发音反演将WavLM特征映射为14维发音与发声元音鼻音特征,得到跨说话人一致的发音器官表征。接着对配对语句用动态时间规整对齐发音特征序列,对任意录音则用最优传输比较说话人级特征分布,前者的对齐帧进入代价累积,后者的聚类中心进入传输耦合。最后以对齐累积代价或传输代价为距离,并回溯高代价区定位如卷舌音等具体差异。与口音分类嵌入GenAID相比,其关键机制差异是距离定义在发音器官空间而非判别性嵌入空间,因而可直接读出舌位变化而非仅给出整体相似分。在VCTK苏格兰、英格兰、爱尔兰三分类任务下,Art+VVN对齐的分类准确率为99,高于WavLM对齐的94。该结论的适用边界受限于英语区域口音朗读体,尚未验证自发对话、跨语言与韵律主导差异下的稳定性。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


34. 每秒给出群体氛围单值并标记分歧:连续群体情绪的滑动窗口多模态建模

英文题目:Multimodal Temporal Modeling for Continuous Group Emotion Recognition in Multi-party Dialogues

标签:#语音情感识别 | #Transformer | #多模态学习 | #音视频

评分:6.0/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Soma Iwata:Kyoto University, Kyoto, Japan
  • Koji Inoue:Kyoto University, Kyoto, Japan
  • Muyun Wu:Kyoto University, Kyoto, Japan
  • Taiga Mori:Kyoto University, Kyoto, Japan
  • Divesh Lala:Kyoto University, Kyoto, Japan
  • Tatsuya Kawahara:Kyoto University, Kyoto, Japan

📌 核心摘要

本文处理三人日语多方对话中群体情感连续识别,输入为分人音频与正面视频,输出为每1秒效价与唤醒度分布,难点是群体状态非个体叠加且在话语内与静默段快速漂移。方法分三步:先用冻结Whisper编码器与SigLIP 2编码器分人抽取音频与视觉特征并对齐到帧级,再拼接成多参与者多模态序列送入时序Transformer,最后以20秒滑动窗口末端输出1秒情感分布。训练采用平方推土机距离损失建模负二至正二五类序关系,并以类别时长倒数加权损失与加权采样缓解零类主导。相对话语级个体情感识别,该设计以因果滑动上下文建模动态过程,并用混合状态显式标记不可归一的分歧段,具有连续跟踪话语内转变与静默氛围的实际意义。在TEIDAN测试集AV(20s)评测设置下,时序Transformer的唤醒度一致性相关系数CCC指标为0.807,高于大语言模型基线的唤醒度一致性相关系数CCC指标0.747。高混合分歧段平均绝对误差增大表明单值表示在分歧时失效,适用边界受限于12组日语实验室对话与单次划分,且测试说话人不独立,外推至其他文化与场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


35. 资源受限下做通用阿拉伯语语音大模型:Nuha-Speech 的数据、微调与评测链路

英文题目:Nuha-Speech: Building General-Purpose Arabic Speech-LLMs

标签:#音频问答 | #指令微调 | #数据集 | #基准测试

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Yingzhi Wang:Elm Company, KSA
  • Reem Alhazzani:Elm Company, KSA
  • Muhammad Alqurishi:Elm Company, KSA

📌 核心摘要

输入为多方言阿拉伯语语音与文本指令、输出为纯文本回复,难点在于方言变异大且情感年龄等副语言标注稀缺。方法先整合MGB-2、MASC、SADA与Common Voice等多源公开语料,并用Qwen3-32B生成翻译与问答对、用ElevenLabs合成情感年龄语音,统一为语音指令输出三元组约150.1万条。接着采用两阶段课程先以约79万条ASR数据建立音频文本对齐,再以20万条ASR加71.1万条多任务数据在冻结音频编码器下以LoRA微调Qwen-Omni大语言模型,前阶段对齐输出直接作为后阶段语义与副语言泛化的基础。最后构建覆盖识别、翻译、问答、方言、情感、年龄与性别的七任务基准,以微调前后对比验证效果。相对仅支持三任务的Octopus,关键差异在于将ASR作为对齐基础后扩展到问答翻译与副语言多任务指令泛化,意义在于补齐可复现的阿拉伯语音指令数据与评测空白。在OUAAL基准测试集下,Nuha-Speech-7B的WER为34.91%,低于Qwen2.5-omni-7B的74.74%。该结论适用边界限于现代标准语与所覆盖方言及合成情感语音,跨方言零样本与真实情感泛化尚未验证。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


36. 不靠听觉也能偏爱十二平均律:从任意唱名数出发重建转位等价

英文题目:A General Approach to Enharmonicism

标签:#音乐理解 | #形式化分析 | #音乐

评分:5.9/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5

排名:前50% | 文档类型:理论研究 | arXiv 原文

👥 作者与机构

  • Caleb Scott Alons:Department of Mathematics, University of Missouri - Columbia

📌 核心摘要

该研究输入为任意全音集合与修饰符集合,输出为半音排序、等音等价划分及其上的音程命名与调性系统判据,难点在于不依赖音高与律制预设而在任意基数下保持语法的良定义与可计算性。其方法链首先以循环群步进与素全音排序构造全音空间与旋转类并引入反射性定义,为后续扩张提供有序基底。其输出的排序结构进入下一步用于生成素半音排序与有序半音集,以修饰操作提升结构复杂度并衔接等音构造。最后以等音指派向量与同余关系构造等音等价关系并导出等音集、素等音排序与等音系统,进而用反射与最大偶性判别音乐实用性。相对Hook限定于标准七全音的句法理论,该方法的关键差异在于将全音、半音与等音统一为任意基数下的可计算框架,并以纯数学性质解释标准系统的优越性而非诉诸听觉经验。在标准键盘设置下,标准等音集的白键数量指标为7,高于黑键数量指标的5。该结论的适用边界限于句法层面的系统比较,尚未验证记谱可读性、作曲可用性与听觉接受度,也未覆盖调号与和声进行等上层结构。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


37. 会话共现能否留下歌手之外的听感结构:一次可证伪的残差检验

英文题目:Project Qualia: Recovering Experiential Music Structure from Session Co-occurrence Data

标签:#音乐理解 | #自监督学习 | #音乐 | #数据清洗

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Nizam Mohammed:Independent Researcher
  • Abu B. S. Rahman:Department of Computer Science Hampton University, VA 23669, USA
  • Dimuthu D. K. Arachchige:Department of Computer Science Hampton University, VA 23669, USA

📌 核心摘要

本文输入为Last.fm重度用户连续播放会话,输出为跨艺人可比的歌曲体验相似结构,难点在于原始共现被单艺人连播与重复播放主导而掩盖独立风格信号。方法先以30分钟间隔重建会话并经六阶段清洗去除自动播放与低频曲目,由12.9亿次播放得到5.316亿次训练播放与2860万会话语料。接着将会话视作句子训练跳字模型得到Song2Vec嵌入,使共现曲目在向量空间中邻近。随后对每位艺人求质心并相减归一化得到残差向量以剥离艺人身份,并送入随机对比较与近邻检验。与直接预测歌曲身份的共现目标不同,残差分析将身份与风格分离放在训练后诊断,从而检验数据是否含有独立信号并为联合嵌入预测架构提供前提。在跨艺人最近邻检索任务下,肖邦作品跨艺人邻居的余弦相似性指标为0.941,低于同艺人邻居的0.955。该结论适用边界受限于重度用户群体与手选示例验证,尚未验证向普通听众与推荐性能的外推,且原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


38. 回声定位时断时续时,如何把碎裂的鲸轨迹重新连成一条

英文题目:Bridging Echolocation Gaps in Automated Beaked Whale Tracking

标签:#声源追踪 | #状态空间模型 | #生物声学监测 | #麦克风阵列

评分:5.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

排名:前50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Clair Ma:Scripps Institution of Oceanography and Department of Electrical and Computer Engineering, University of California at San Diego, La Jolla, California 92093, USA
  • Thomas Kropfreiter:Institute of Telecommunications, TU Wien, 1040 Vienna, Austria
  • Lauren Baggett:Scripps Institution of Oceanography, University of California at San Diego, La Jolla, California 92093, USA.
  • Simone Baumann-Pickering:Scripps Institution of Oceanography, University of California at San Diego, La Jolla, California 92093, USA.
  • Florian Meyer:Scripps Institution of Oceanography and Department of Electrical and Computer Engineering, University of California at San Diego, La Jolla, California 92093, USA

📌 核心摘要

被动声学监测以方位角与俯仰角波达方向click检测为输入,估计鹅喙鲸数量与二维连续轨迹,难点在于高指向性波束与潜水停鸣导致跨越数分钟的非独立连续漏检使标准伯努利检测假设失效而轨迹碎裂。先由置信传播多目标跟踪在非均匀时间网格上逐时刻滤波,以DOA检测为输入负责概率数据关联与存在估计,输出存在概率与方位俯仰速度四维状态的碎片轨迹。再由前向后向平滑以碎片轨迹为输入,以前向终态初始化后向轨迹并融合过去与未来观测负责去噪,输出平滑片段并送入拼接。最后由滑动窗口拼接以平滑片段为输入,按恒速预测旧片段终点至新片段起点并以协方差加权差为代价用匈牙利算法求解一对一指派负责桥接长间隙,输出合并后连续轨迹并迭代进入下一窗口。在包含300个仿真场景与300次蒙特卡洛运行的评测设置下,所提BP平滑拼接方法的GOSPA总误差指标低于高斯混合概率假设密度方法的GOSPA总误差指标,其中漏检目标误差指标是总误差改善的主要来源。与不做概率数据关联的高斯混合概率假设密度方法相比,关键差异是从并发融合转为禁止时间重叠的时域非重叠片段级联,并以显式拼接桥接行为驱动长间隙,减少漏检导致的碎裂。超长间隙与交叉点附近间隙的关联适用边界受限,尚未验证由二维方位俯仰向三维跟踪的外推范围。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


39. 网络先认说话人,聚类再认网络的认法:二阶模式识别如何判定未见语音

英文题目:Exploring Second-Order Pattern Recognition in Speaker Recognition

标签:#说话人识别 | #无监督学习 | #可解释性 | #语音

评分:5.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5

排名:后 50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Yanze Xu:机构信息未在 arXiv HTML 中可靠披露
  • Wenwu Wang:机构信息未在 arXiv HTML 中可靠披露
  • Mark D. Plumbley:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该任务输入为未见语音话语的说话人嵌入,输出为其适用哪些已发现二阶模式及对应语义解释,难点在于已知表征聚类边界僵硬且语义不可读,跨话语泛化缺乏可判定准则。方法链分三步:先用已训练说话人识别网络提取已知话语嵌入,再用单链接层次聚类SLINK挖掘嵌套簇作为二阶模式,其输出簇结构直接进入下一步。接着用层次聚类类别匹配HCCM将簇与性别国籍语义类一对一匹配赋予可读解释,解释后的候选模式进入导航判定。最后用层次聚类导航分配HCNA沿最近邻已知表征所在嵌套路径逐层检验未见表征是否落入候选簇外推空间,从而逐个确认适用模式。与固定比例放大经验空间不同,HCNA用梯度代价比自适应收缩或扩张每簇判定半径,以反映并入未见表征相对并入兄弟簇的难易,实际意义在于同等外推幅度下保留更多有效路径。在VoxCeleb1已知集与VoxCeleb2未见集评测下,HCNA GCR extrap.的路径完备度指标Path completeness为34.19%,高于HCNA w/o extrap.的11.68%。该结论适用边界受限于ResNetSE34L嵌入、欧氏最近邻路径与性别国籍语义,尚未验证对其他骨干网络、距离度量或细粒度语义的外推有效性。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


40. 拷贝太多成抄袭,随机太多成噪音:用平均序列长度控制 LZ 音乐生成

英文题目:Copying Versus Randomization in Lempel-Ziv Music Synthesis

标签:#符号音乐生成 | #生成模型 | #音乐 | #开源工具

评分:5.3/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.3/1.5 | 清晰度 0.6/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5

排名:后 50% | 文档类型:方法研究 | arXiv 原文

👥 作者与机构

  • Nadav Mishan:机构信息未在 arXiv HTML 中可靠披露
  • Ram Zamir:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该文处理符号音乐生成任务,输入为钢琴演奏的MIDI音高序列,输出为新生成的音高序列,难点在于标准通用压缩为追求压缩效率而整段复制训练数据,难以在借鉴已有风格与保持原创变异之间取得平衡。方法第一步做差分预处理,将绝对音高序列转换为相邻音符间隔序列,以凸显跨调式与跨八度的重复结构,并将该相对间隔序列作为后续建模的输入。第二步用Lempel-Ziv七八算法构建频率加权的字典树集成,通过限制每棵树分配的训练数据量来降低平均短语长度,并通过延迟返回根节点的步数参数来延长分支深度以增大平均短语长度。第三步进行集成生成,轮换均匀挑选一棵树后按子节点历史频率概率游走直至到达叶节点,输出相对间隔片段后再转回绝对音高,并循环选树拼接为完整旋律。与单树追求最大压缩而直接复制长连续片段的已有做法不同,该机制把复制粒度变为由数据量与步数共同控制的可调参数,在过拷贝的连贯性与欠拷贝的随机性之间进行权衡。在图示生成场景的评测设置下,符号A的指标为3/5,高于符号B的指标为2/5。该结论适用边界受限于仅用平均序列长度随数据量与步数变化的趋势图和定性听感进行验证,尚未验证节奏表现力缺失与长片段抄袭风险等外推范围的失败条件。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


41. 无菌环境下不敢动手:语音多智能体如何接管手术室设备控制与延迟

英文题目:A Voice-Interactive Multi-Agent System for Smart Operating Rooms: Architecture Design and Key Technologies

标签:#语音交互 | #提示学习 | #医疗音频 | #大语言模型 | #流式处理

评分:5.0/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:后 50% | 文档类型:系统技术报告 | arXiv 原文

👥 作者与机构

  • Tianxiang Zhou:Wuhan United Imaging Surgical Co., Ltd. (UIS);Wuhan, China

📌 核心摘要

手术室语音直控需在无菌约束下把嘈杂连续语音转为多设备安全动作,输入是噪声语音与动态设备状态,输出是可执行设备动作与可播报回复,难点在于轮次误判与长提示变更引发的高延迟重算。系统先经唤醒加语音识别加轮次检测加智能体推理加语音合成的外层链路将语音转文本并判别是否为医疗指令,判别后的文本进入内层智能体核心。内层按角色与设备与手术阶段动态裁剪技能提示并由任务规划器构建可执行有向无环图,经调度与设备管理并行执行后输出结构化动作与回复文本再回流至合成播放。相比仅做问答或单机器人控制的已有助手,关键差异在于把字节级最长公共前缀复用预热与流式部分JSON提前执行引入推理与执行耦合路径,减少等待完整生成的空转并提升多意图并行能力。在实验室原型延迟分析设置下,启用前缀预热的系统预填充开销指标从未优化基线的约500 ms降至约50–80 ms。首词延迟同步从约600 ms降至约150 ms至200 ms,使任务执行启动与语音播报无需等待完整JSON解析。该结论适用边界受限于特定模型与推理引擎组合下的理论估算,尚未验证真实手术噪声与多并发下的准确率与稳定性。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。


42. 野外噪声下先收缩去噪再分类:Epanechnikov 贝叶斯小波与倒谱监督学习

英文题目:Processing and classifying bird songs using wavelet techniques and supervised learning

标签:#音频分类 | #信号处理 | #生物声学监测 | #统计分析

评分:3.9/10 | 创新 0.8/2 | 技术严谨 0.8/1.5 | 实验充分 0.7/1.5 | 清晰度 0.4/1 | 影响力 0.4/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后 50% | 文档类型:应用研究 | arXiv 原文

👥 作者与机构

  • Laura Lucia Dominguez Barrios:机构信息未在 arXiv HTML 中可靠披露
  • Fidel Aniano Causil Barrios:机构信息未在 arXiv HTML 中可靠披露
  • Alex Rodrigo dos Santos Sousa:机构信息未在 arXiv HTML 中可靠披露
  • Mariana Rodrigues Motta:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

本文输入为iNaturalist平台2025年采集的高噪声野外鸟声,输出为紫蓝饰雀、红嘴相思鸟与家麻雀三物种中的两两二分类标签,难点在于风声虫鸣他种鸣声与录制距离导致的低信噪比和种内变异。方法链分为四步:静音切除与16 kHz重采样及截断到2的幂统一输入长度,离散小波变换将含噪信号映射到稀疏小波域,点质量加Epanechnikov混合先验的后验均值收缩去噪并逆变换重构波形,去噪波形提取梅尔频率倒谱系数与熵及过零率等特征后训练分类器。去噪重构的输出直接进入特征提取,特征矩阵再按分层抽样划分为训练集与测试集供随机森林、多项逻辑回归与支持向量机比较。与通用阈值收缩相比,该先验支撑自适应且后验均值有闭式解,在低信噪比下更稳并避免迭代计算,利于处理大规模生物声学数据。在Data 2紫蓝饰雀对红嘴相思鸟200次重复的评测设置下,支持向量机的准确率为0.9398,高于多项逻辑回归的0.9376。该结论适用边界仅限小样本两两二分类与200次重复平均,尚未验证多物种混叠、长时声景检测与跨设备泛化等外推。原文未披露训练、推理或部署成本。

🔗 开源资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。