共分析 38 篇论文
⚡ 今日概览
✅ 筛选入选 38 篇 → 🔬 深度分析完成
🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。
🏷️ 热门方向
| 方向 | 数量 | 分布 |
|---|---|---|
| #语音对话系统 | 5 篇 | █████ |
| #语音识别 | 4 篇 | ████ |
| #音视频生成 | 3 篇 | ███ |
| #语音增强 | 2 篇 | ██ |
| #语音编码 | 2 篇 | ██ |
| #轮次切换 | 2 篇 | ██ |
| #音乐源分离 | 2 篇 | ██ |
| #音乐生成 | 2 篇 | ██ |
📊 论文评分排行榜(38 篇,按分数降序)
📋 论文列表
🥇 语音上下文不能只存文字:用有界编排同时管住说什么、怎么说和何时打断
英文题目:Scalable Context Orchestration for Serving LLMs Over Voice
标签:#语音对话系统 | #检索增强 | #长音频处理 | #流式处理 | #轮次切换
评分:8.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前25% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Linyi Jiang:Global College, Shanghai Jiao Tong University;AgenticSys
- Silvery D. Fu:AgenticSys
- Yifei Zhu:Global College, Shanghai Jiao Tong University
📌 核心摘要
语音大模型以连续流式音频为输入、实时语音回复为输出,难点在于语义内容、韵律特征与声学及网络环境信号相互纠缠且历史随会话线性膨胀,传统扁平追加导致冲突控制失调与每轮成本随长度线性增长、总成本二次增长。第一步负责从当前输入与WebRTC遥测中提取语义状态、韵律状态与环境状态并维护有界观测,提取的显式三态被传递至下一步用于联合推理与运行时控制推导。第二步负责将已完成交互生成为VoicePage并按语义相关性聚合成VoiceThread形成可检索的结构化记忆,生成的线程与页面及其向量索引被送入下一步用于相关性感知的候选筛选。第三步负责由上下文投影器在预算内为候选线程与页面融合相关性与保真度权衡选择音频/转写/摘要的多保真度表示,并由上下文编排器输出内容、风格与轮次控制指令,进入下一步复用服务大模型执行受控生成。与仅追加全量历史或扁平页面级检索相比,该设计以显式三态与线程级结构化记忆替代隐式音频上下文,实现了冲突可解释消解与跨轮证据局部性保持的有界上下文构造。在论文报告的评测设置下,本文方法相较Fixed-500的False-Interruption Rate指标从46.0%降至0.9%,方向为更低。适用边界是:结论在约5分钟电话对话与约58分钟播客长会话及ICASP PLC丢包仿真中验证,对极长会话、强口音或多说话人重叠等场景的外推尚未充分验证。成本方面,原文报告有界上下文使长会话每轮成本较OpenAI全量历史降低达24.9倍,记忆组织额外增加约50.9至78.4毫秒时延,有控制函数调用的轮次另有约790.2毫秒决策时延。
🔗 开源资源
代码相关资源:https://llmovoice.com — 链接可访问(HTTP 200)
演示资源:https://llmovoice.com — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥈 听见的对话如何被核查:TRILOGUE 把多轮声称钉回源文章与配对音频
英文题目:TRILOGUE: A Trilingual Spoken Dialogue Fact-Checking Benchmark with Evidence and Paired Audio
标签:#语音对话系统 | #基准设计 | #多语言 | #基准测试
评分:8.4/10 | 创新 1.6/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Chaewan Chun:The Pennsylvania State University, USA
- Meruyert Aristombayeva:Satbayev University, Kazakhstan
- Jiyoung Choi:Independent Researcher
- Mahjabin Nahar:The Pennsylvania State University, USA
- Delvin Ce Zhang:机构信息未在 arXiv HTML 中可靠披露
- Dongwon Lee:The Pennsylvania State University, USA
📌 核心摘要
输入为含噪声ASR转写的双人播客式口语对话,输出为轮次级可核查性判定、源文章句级证据检索与三分类事实判定,难点在于主张跨轮次分散、口语修复与ASR误差叠加导致上下文依赖与文本失真。第一步负责以12,013篇英俄哈新闻及受控幻觉改写为源池,用Gemini 2.5 Flash与DeepSeek-V3.1在14至20轮约束下生成对话并过滤至11,957段,该输出传递至下一步用于标注。第二步用于以Gemini 2.5 Pro温度0对干净原文做确定性轮次标注生成可核查性与True/False/NEI标签及原文句级证据,标注结果送入下一步用于语音合成。第三步负责经TTS与4,998段人录音频合成390.3小时配对语音并用Whisper large-v3转写与WhisperX/wav2vec2对齐生成ASR转写与词级时间戳,该配对数据进入下一步用于评测构建。第四步用于按源文章族划分80/10/10构建三任务评测并输出可核查性检测、证据检索与验证的统一基准,该基准传递为后续诊断分析的输入。与仅有英文小规模或无配对音频的既有资源相比,该设计通过多语对话、配对音频与证据链的联合可控生成实现口语鲁棒性与跨语迁移的直接对比。在论文报告的评测设置下,哈萨克语ASR条件下本文mDeBERTa证据增强验证相较仅看主张验证的F1False指标从58.0升至72.0,方向为更高。适用边界是:结论仅适用于源内证据定位的受控播客对话,对开放域溯源、真实社交媒体对抗性谣言及语音原生建模尚未验证。成本方面,原文未披露训练与推理成本,仅报告约400 H100 GPU小时的ASR与评测开销。
🔗 开源资源
- 数据相关资源:https://huggingface.co/datasets/chaewanC/TRILOGUE — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🥉 不训练也能听懂说话:冻结视觉语言模型的外挂语音路由何时够用
英文题目:Training-Free Speech-Centric Omni Understanding with Frozen VLMs
标签:#音视频理解 | #模型融合 | #语音 | #多语言
评分:8.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.5/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ankan Deria:机构信息未在 arXiv HTML 中可靠披露
- Hanoona Rasheed:机构信息未在 arXiv HTML 中可靠披露
- Xilin He:机构信息未在 arXiv HTML 中可靠披露
- Fahad Shahbaz Khan:机构信息未在 arXiv HTML 中可靠披露
- Salman Khan:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音视频理解的输入是口语音频与图像视频帧及其时间对应,输出是联合推理后的文本或口语回答,难点在于口语内容、视觉事件与时序关系需对齐,而原生全模态常需为每个新骨干重做音频编码与跨模态对齐。第一步由Whisper前端负责提取带语言、时间戳与置信度的文本片段,并将转写结果传递至过滤环节。第二步由置信度过滤负责剔除不可靠片段并保留可信语音证据,再将保留片段连同时间锚点送入冻结视觉语言模型的语言提示。第三步由冻结视觉语言模型负责融合视觉通路的帧特征与语音文本以生成回答,并将回答送入可选语音合成以输出口语回复。与同家族原生全模态相比,该语言级路由避免修改骨干与重做音视频文本对齐,把能力扩展转为可复用的前端转写。在论文报告的评测设置下,本文方法相较MiniCPM4.5-O的BLEU-1指标从33.6升至46.3,方向为更高。适用边界是:结论仅适用于以可转写语音为主要证据的问答与翻译,在音乐、环境声及需校验声音真实性的匹配任务上不再成立。成本方面,原文指出主要代价是串行自动语音识别推理延迟,同音视频多问题可复用一次转写摊薄开销。
🔗 开源资源
- 第三方资源:https://github.com/alibaba-damo-academy/MedEvalKit — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. AVENUE:当提示只改一个模态时,模型能否守住另一个模态
英文题目:AVENUE: Audio-Video EditiNg Understanding and Evaluation
标签:#音视频生成 | #基准设计 | #基准测试 | #数据集 | #音视频
评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Hayeon Kim:Ulsan National Institute of Science and Technology (UNIST)
- Yoojin Jang:Ulsan National Institute of Science and Technology (UNIST)
- Jaejun Yoo:Ulsan National Institute of Science and Technology (UNIST)
📌 核心摘要
音视频编辑的输入为源视频、源音频与文本提示,输出为按提示修改后的音视频,难点在于模型需仅从提示推断模态选择性编辑范围并在保留非目标模态的同时精准修改目标模态。第一步负责从VGGSound测试集经音视频质量与编辑适宜性两级过滤提取高质量片段并输出1,291个源片段,该输出被传递至下一步的指令生成。第二步用于按8类语义类别的类别感知模板调用Gemini-3-flash生成12类编辑指令并经人工校验输出7,957条样本,该样本集被送入下一步的评测构建。第三步负责为每样本标注what_changed与what_preserved作为伪真值并融合Qwen3-Omni实现编辑准确率、模态选择性、感知质量与音视频一致性的模态感知评测,其结果进入下一步的范式对比分析。与仅覆盖音视频耦合替换且评测模态盲、样本无关的既有基准相比,该框架显式分离音频目标、视频目标与耦合编辑并引入样本特定的选择性可控性度量,实际意义在于暴露跨模态无意篡改的根本权衡。在论文报告的评测设置下,本文方法相较RAVE++ZETA的Edit Accuracy指标从79.7降至64.1,方向为更低。适用边界是:结论仅在约10秒短片、VGGSound来源及所测联合、序列、分离三类范式内验证,长视频时序一致性与祈使式指令等场景尚未覆盖。成本方面,原文披露推理成本为AvED约20分钟/样本、RAVE约35分钟/样本,训练与部署成本未系统披露。
🔗 开源资源
数据相关资源:https://huggingface.co/datasets/AVENUE-dataset/AVENUE — 暂时无法访问
数据相关资源:https://creativecommons.org/licenses/by/4.0/ — 链接可访问(HTTP 200)
第三方资源:https://creativecommons.org/licenses/by/4.0/ — 链接可访问(HTTP 200)
第三方资源:https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2 — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 不用先转文字:音素瓶颈加单调对齐如何把尝试发声的脑信号直接变成可懂语音
英文题目:Brain2Speech-Net: Intelligible, Real-Time Brain-to-Speech Synthesis Without Text Decoding
标签:#言语神经解码 | #端到端学习 | #脑信号 | #语音 | #实时处理
评分:7.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Shreeram Suresh Chandra:机构信息未在 arXiv HTML 中可靠披露
- Zexin Cai:机构信息未在 arXiv HTML 中可靠披露
- Yu Tsao:机构信息未在 arXiv HTML 中可靠披露
- Simon King:机构信息未在 arXiv HTML 中可靠披露
- Berrak Sisman:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文处理尝试性言语下颅内运动皮层多通道分箱特征到可懂语音波形的直接合成,输入无可听声学目标可供监督,且数据仅约5.71小时并要求会话级实时响应。第一步,脑内容编码器负责将会话嵌入融合的长时神经帧映射为帧级音素后验瓶颈以提取语言证据,并将该瓶颈表征传递至对齐模块。第二步,轻量可微深度隐马尔可夫对齐器用于学习神经帧到预训练语音合成文本编码器隐空间的单调对齐,并将软池化后的等长上下文音素表征送入语音解码器。第三步,预训练语音合成解码器负责将该表征一次性生成波形并输出为最终语音,该单阶段路径进入下一步推理时无需文本解码。相对级联式神经到文本到语音与直接声学单元预测,关键差异在于保留可微音素结构约束但不做硬文本判决,从而避免语言模型覆盖神经证据与跨阶段误差累积,实际意义是兼顾小数据效率与低延迟。在论文报告的评测设置下,本文方法相较DSU baseline的WER指标从1.011降至0.068,方向为更低。适用边界是:结论仅适用于单被试英语尝试性言语与合成伪语音目标的封闭集评测,开放词汇泛化与说话人身份及韵律保真尚未验证。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://b2s-lang.github.io/ — 链接可访问(HTTP 200)
模型相关资源:https://b2s-lang.github.io/ — 链接可访问(HTTP 200)
第三方资源:https://github.com/jaywalnut310/vits — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 终端一两层决定是否接地:对 ASR 幻觉必要条件的因果定位
标签:#语音识别 | #评测协议 | #可解释性 | #鲁棒性 | #语音
评分:7.7/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.9/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.4/0.5 | 工程/实践 0.8/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hamees Sayed:Smallest AI
- Apoorv Singh:Smallest AI
- Kumar Aman:Smallest AI
- Akshat Mandloi:Smallest AI
📌 核心摘要
自动语音识别需将连续声学输入转写为离散文本,在编解码器失真、混响与口音偏移下易出现与音频脱节的输出,难点在于定位接地约束在网络何处失效。第一步负责以WildASR七环境与L2-ARCTIC六口音为压力源并采用贪心解码生成基线转写与发散标记,其输出传递至下一步用于因果定位。第二步负责对两个独立训练的Conformer-Large编码器(CTC与RNN-T)实施逐层跳过干预并统计发散率与词错率,干预结果送入下一步与几何可读性观测对齐。第三步负责计算有效秩、执行编码器透镜解码与线性探针以提取表征紧致度与字形可读性变化并融合大语言模型五类语义分型以区分编造与崩溃,其分型结果进入下一步生成最终机制结论。在论文报告的评测设置下,本文方法相较跳过中段块L=2-13的发散率指标从≤8.5pp升至94至99pp(CTC末块跳过每条件增量)方向为更高。相较于仅在解码器侧做内部语言模型估计的既有补救,该工作将关键差异锚定在编码器末级一至两块的终端压缩与可读性跃迁,证明接地失效的先决条件位于编码器而非预测器且中段12层几乎冗余。适用边界是:结论仅在所测英语Conformer与贪心解码范围内成立,对语音大模型、注意力编码器解码器及波束搜索下的自然幻觉起源尚未验证。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
模型相关资源:https://huggingface.co/nvidia/stt_en_conformer_ctc_large — 暂时无法访问
模型相关资源:https://huggingface.co/nvidia/stt_en_conformer_transducer_large — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 轮到谁说话,标签说了算:因果监督如何拆掉流式端点的假权衡
英文题目:The Trade-off Was in the Labels: Causal Supervision for Turn-Aware Streaming ASR
标签:#轮次切换 | #LoRA | #流式处理 | #严格因果 | #基准测试
评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Bojie Li:机构信息未在 arXiv HTML 中可靠披露
- Noah Shi:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音代理需在连续单通道音频流上逐块输出递增转写,并在语义完整加短暂静音时一次性提交不可撤销的轮次结束触发,难点是轮内停顿与轮间间隙在时长上几乎完全重叠。方法链分三步推进:先以因果规则统一标注,仅当转写启发式判定语义完整且波形中已观测到足够静音才允许触发,接着用最小对偶与停顿对偶把可观测差异变成唯一监督信号,最后把触发标记作为普通词表标记与转写同解码输出并辅以能量门与确认视界做部署裁决。与阈值滑动曲线的关键机制差异是模型读完整性而非读时长,因而能同时做到对未完成数字串耐心等待与对已完成短句快速响应。在 25 段 AMI 复播基准上因果模型达到边界召回 0.969,中位延迟 0.39 s,每语音分钟误触发 0.3 次,全面进入任何静音超时都到不了的角落。结论限于单说话人单通道英语会议复播与合成听写实体场景,一词命令与超长枚举等完整性判断仍不可靠。训练为单 GPU 数小时的轻量适配,流式 serving 在部分 GPU 切片上满足实时预算。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. GhostWord:把后门藏进单词时间轴里,防御为何越洗越伤干净转写
英文题目:GhostWord: A Fine-Grained Backdoor Attack on Automatic Speech Recognition
标签:#语音识别 | #数据增强 | #音频安全 | #语音 | #多语言
评分:7.6/10 | 创新 1.6/2 | 技术严谨 1/1.5 | 实验充分 1.3/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Mojtaba Nafez:机构信息未在 arXiv HTML 中可靠披露
- Mobina Poulaei:机构信息未在 arXiv HTML 中可靠披露
- Kiarash Kiani Feriz:机构信息未在 arXiv HTML 中可靠披露
- Aref Mousavi:机构信息未在 arXiv HTML 中可靠披露
- Mohammad Ebrahim Mahdavi:机构信息未在 arXiv HTML 中可靠披露
- Mohammad Mosayebi:机构信息未在 arXiv HTML 中可靠披露
- Mohammad Hossein Rohban:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
自动语音识别需将连续语音波形转写为长词序列,输出词汇超万级且时序对齐可变,传统短语级后门因整句替换留下强统计痕迹而易被冗余转写等预处理过滤。第一步构建触发器到目标词的码本负责定义多组约400ms短时噪声与目标词的映射关系,并将选定映射传递给对齐与注入环节。第二步基于CTC的MMS强制对齐用于定位源词时间区间并保持邻近发音不受干扰,并将该区间位置送入触发器叠加操作。第三步按22dB信噪比约束生成带限噪声并叠加于词段中心以输出单点语义翻转的中毒样本,该样本进入下一步推理时在任意位置叠加触发器即诱发对应目标词,相对整句映射到固定恶意文本的机制将多对一异常分散为融入自然词频的局部替换并藏于语音段内以规避语音活动检测。在论文报告的评测设置下,本文方法相较ABL、ANP、i-BAU和SAU最强优化防御组合前的ASRattack指标从89.3%降至29.1%,方向为更低。适用边界是:结论限于Common Voice v23英文与v24立陶宛文上Whisper-Small/Medium、MMS-1B和SpeechT5的数字插入与50句流式块及单环境1.5m空中播放验证,增大码本或降低投毒率时成功率明显衰减且未验证其他语言与强流式对齐漂移下的外推。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/rohban-lab/GhostWord — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 多深度谐波卷积如何让乐器无关转录在小参数下仍保持高帧精度
英文题目:Harmonica: Accurate and Lightweight Instrument-Agnostic Music Transcription
标签:#音乐转录 | #CNN | #音乐 | #高效推理 | #端侧运行
评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5
排名:前25% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Longshen Ou:机构信息未在 arXiv HTML 中可靠披露
- Héctor Martel:机构信息未在 arXiv HTML 中可靠披露
- Joe Hennessy-Priest:机构信息未在 arXiv HTML 中可靠披露
- Taemin Cho:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
乐器无关音乐转录(Instrument-Agnostic Music Transcription)需从单乐器音频中恢复与乐器无关的音符事件集合,难点在于跨乐器音色差异大、谐波重叠严重且低音区基频在短时傅里叶变换(Short-Time Fourier Transform, STFT)中难以分辨。Harmonica 以常数 Q 变换(Constant-Q Transform, CQT)谱图为输入,先经浅层前端下采样至每半音 1 频点,再由多层谐波卷积(Harmonic Convolution)与残差块交替构成的主干在多抽象层级上聚合谐波与次谐波证据,最后由频分组长短期记忆网络(Frequency-Grouped Long Short-Term Memory, FGLSTM)三头分别预测起始(onset)、持续(sustain)和结束(offset)帧级激活并经阈值解码为音符。相较于输入端谐波堆叠(harmonic stacking)、单层谐波卷积或谐波注意力(harmonic attention),多深度谐波卷积在不同表征层级反复校正基频假设并抑制泛音误判,同时以移位拼接加 1×1 卷积替代多分支空洞卷积实现参数高效化。在 8 个数据集构成的乐器无关基准上,x-large 模型在全部域内测试集取得帧级 F1 第一,medium 模型以 679K 参数达到近最优精度且推理速度超越全部基线。结论适用于单轨独奏场景,对多乐器混合的声源归属、极端失真音色外推及长时结构建模尚未验证。训练采用 100k 步、批大小 8 的有监督流程,推理在 RTX 4090 上可达千倍实时,medium 模型在 iPhone 15 Pro Max 上经 LiteRT 仍达 32.1 倍实时且峰值内存低于 445 MB。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. PRISM-Bench:用音频类型与声源可见性交叉诊断文生音视频的接地能力
英文题目:PRISM-Bench: An Audio-Centric Diagnostic Benchmark for Text-to-Audio-Video Generation
标签:#音视频生成 | #基准设计 | #基准测试 | #人类参与评测 | #音视频
评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5
排名:前25% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Yuchen Sun:Shanghai Artificial Intelligence Laboratory, Shanghai, China
- Qian Yang:Meituan, Beijing, China
- Jun Wang:Meituan, Beijing, China
- Detai Xin:Meituan, Beijing, China
- Guoqiao Yu:Meituan, Beijing, China
- Guanglu Wan:Meituan, Beijing, China
- Qi Jia:Shanghai Artificial Intelligence Laboratory, Shanghai, China
📌 核心摘要
文本到音视频生成以文本提示为输入、同步生成视频与对应音频为输出,难点在于不同音频类型与声源是否可见对时序对齐与物理合理性提出异质化接地要求,现有基准多将音频视为视频附属而缺乏联合分层诊断。PRISM-Bench构建了900条人工校验样本的诊断基准,其方法链为:先经PySceneDetect分场景采样并截取至88秒片段形成评测单元,再由Gemini 2.5 Pro多模态字幕与Qwen3-Omni纯音频字幕经GPT-5 Chat(gpt-5-chat-latest-2025-08-07)融合生成结构化标签与人校正字幕,接着按音频类型(Speech / Music / Sound)与可见性(On-screen / Off-screen)正交划分为On-screen、Off-screen、Mixed各300对的三个子集,最后以标签条件激活的双阶段盲式并排裁判对音频视觉一致性等四维度35准则进行绝对打分与证据生成。与以往按任务或场景的整体评分不同,该设计强制在相同提示下分离感知保真与可见源接地,揭示保真提升不等同接地提升。评测显示Seedance 2.0在On-screen Final得分97.73超过校准后真值91.78,但在音频视觉一致性仅20.91略低于真值20.93,暴露可见源同步仍是瓶颈。该结论适用于当前8种主流系统在所覆盖的影视与日常场景,跨语言与长时叙事外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://huggingface.co/spaces/prismbench/prismbench-leaderboard — 链接可访问(HTTP 200)
数据相关资源:https://huggingface.co/spaces/prismbench/prismbench-leaderboard — 链接可访问(HTTP 200)
演示资源:https://huggingface.co/spaces/prismbench/prismbench-leaderboard — 链接可访问(HTTP 200)
复现相关资源:https://huggingface.co/spaces/prismbench/prismbench-leaderboard — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 边说话边动:把全身动作做成对话模型的原生输出
英文题目:Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue
标签:#语音对话系统 | #端到端学习 | #数据集 | #基准测试
评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Chengqian Ma:机构信息未在 arXiv HTML 中可靠披露
- Wei Tao:机构信息未在 arXiv HTML 中可靠披露
- Haoyu Zhang:机构信息未在 arXiv HTML 中可靠披露
- Yiwen Guo:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
口语动作模型需以用户语音为输入,同时输出可懂的回应语音与伴随该回应的面部表情及手部、上半身和下半身动作,难点在于语音与动作速率异构且级联需二次推理而无法联合优化。第一步由语音投影器与大语言模型负责对话规划并提取回应语义,其输出被送入语音生成器进入下一步。第二步由语音生成器负责自回归生成离散语音单元并解码波形,其隐状态与插值后语音单元嵌入被传递至动作生成器进入下一步。第三步由部位感知动作生成器用于融合语音隐状态键值与语音查询并生成四部位离散动作码,并将结果传递为渲染输出。与先合成波形再驱动动作的级联相比,该机制省去音频到动作的第二遍推理并允许动作梯度回传对话通路。在论文报告的评测设置下,本文方法相较MO-audio + LOM的RTF指标从4.39降至0.78,方向为更低。适用边界是:结论限于英语SwDA-500离线整句评测与教师分布内协同语音动作,对分布外舞蹈式或强情感动作和流式交互尚未验证。成本方面,训练在44卡上进行且单卡SwDA-500上完整语音加动作响应耗时4.32秒。
🔗 开源资源
- 演示资源:https://step-out.github.io/Motion-Omni-Page/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 不用时间刻度做修复:判别表示如何指示流匹配的剩余路程
标签:#语音增强 | #流匹配 | #语音 | #形式化分析 | #高效推理
评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Shrishti Saha Shetu:机构信息未在 arXiv HTML 中可靠披露
- Emanuël A. P. Habets:机构信息未在 arXiv HTML 中可靠披露
- Andreas Brendel:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音增强的输入为含噪混响观测,输出为干净语音估计,难点在于不同样本的信噪比、缩放与初始分布差异使同一插值时刻对应完全不同的剩余退化量、分布距离与恢复难度。第一步负责由冻结判别编码器从当前生成状态提取判别流状态表征,该表征按退化严重度组织并朝干净流形单调演化,并将其传递给速度网络作为条件。第二步用于以该表征替代全局时间嵌入来条件化速度场并回归目标速度,学到样本自适应的传输进度,并将该进度信号送入欧拉积分器以驱动波形迭代更新。第三步负责由表征预测器估计难度并动态分配积分步长与函数评估预算,生成渐进净化波形并将其传递至下一积分迭代直至输出最终估计。与标准条件流匹配及无时间自回归流相比,关键机制差异在于传输进度由样本自适应潜状态而非全局时钟驱动,其实际意义在于区分同时刻不同退化样本并实现按难分配算力。在论文报告的评测设置下,本文方法相较FlowSE的SI-SDR指标从18.99升至19.63,方向为更高。适用边界是:结论限于加性噪声与轻度混响的受控语音评测,在强混响去混响任务与弱判别器条件下增益明显收窄且未验证跨语种与端侧泛化。成本方面,原文披露单卡A100训练800000步、模型65.8M参数量级与自适应推理平均6.27 GMACs每帧,但未披露训练时长与端侧实时系数。
🔗 开源资源
第三方资源:https://github.com/seongq/flowmse — 暂时无法访问
第三方资源:https://github.com/yh-jun/SNR-Aligned˙diffSE/blob/main/sgmse-bbed/sgmse/backbones/snrnet.py — 链接不可用(HTTP 404)
第三方资源:https://github.com/PoKoHA/Speech˙Enhancement-DCCRN — 暂时无法访问
第三方资源:https://github.com/narrietal/Fast-ULCNet — 暂时无法访问
第三方资源:https://github.com/Andong-Li-speech/TaylorSENet — 链接可访问(HTTP 200)
第三方资源:https://github.com/JupiterEthan/GCRN-complex — 暂时无法访问
第三方资源:https://github.com/LCAV/pyroomacoustics — 暂时无法访问
第三方资源:https://github.com/sp-uhh/deep-non-linear-filter/blob/main/src/data/data˙gen˙var˙pos.py — 链接不可用(HTTP 404)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 无相位也能低延迟重建语音:EffVOC 把窗长钉在 20 毫秒
标签:#语音合成 | #生成对抗网络 | #严格因果 | #高效推理 | #语音
评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.4/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Renzheng Shi:机构信息未在 arXiv HTML 中可靠披露
- Simon Welker:机构信息未在 arXiv HTML 中可靠披露
- Timo Gerkmann:机构信息未在 arXiv HTML 中可靠披露
- Tim Fingscheidt:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文任务是从无相位谱表示重建语音波形,输入为幅度谱或 Mel 系数,输出为宽带 16 kHz 与全带 48 kHz 波形,难点是在 20 ms 因果低延迟下隐式补全相位与高频细节。方法链分为三步:先将波形按 20 ms 周期 Hann 窗、5 ms 帧移分帧并做离散傅里叶变换取幅度谱,再经 80 通道 Mel 滤波器组与对数压缩得到 Mel 系数;然后经两个因果卷积层与两个长短期记忆网络层建模局部动态与长时连贯;最后经四个转置卷积层与各自后接残差块逐级上采样至波形采样率,全带仅调整后两级步幅与核尺寸。与需要高延迟迭代的 Griffin-Lim 算法和 utterance 级生成声码器相比,差异在于全因果单遍直接合成,不做显式相位估计与迭代一致性投影。在 VCTK 测试集上宽带幅度谱与 Mel 模型 MOS 为 4.17 与 4.15,全带为 4.14 与 4.11,均领先同期低延迟基线且距真值 0.03 至 0.05 以内。结论边界限于干净英语朗读 VCTK 及其重采样设置,未验证噪声混响跨语言与长时对话外推。训练为 1M 步 BigVGAN 式对抗训练,推理在单张 NVIDIA A100 上实时因子小于 1,未披露训练耗时与端侧部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 从描述到可改的反馈:VocalCoachBench 为何把声乐指导拆成结构化判定与主张级评估
英文题目:VocalCoachBench: Benchmarking Audio-Language Models on Expert Feedback for Singing
标签:#音乐理解 | #基准设计 | #基准测试 | #音乐 | #音频大模型
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Hayeon Bang:机构信息未在 arXiv HTML 中可靠披露
- Hounsu Kim:机构信息未在 arXiv HTML 中可靠披露
- Wonil Kim:机构信息未在 arXiv HTML 中可靠披露
- Juhan Nam:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
VocalCoachBench 面向歌唱音频输入与专家级教练反馈输出,难点在于同一演唱可对应多种合理诊断与纠正策略,单一分数或唯一参考答案无法刻画教学有效性。方法链分四步:先构建双子集音频源与 18 位职业声乐教练的标注协议,产出 Top-3 问题标签与分块自由文本;再经 LLM 将自由文本分解为 12,051 条原子诊断、纠正与优点 claim 并保留纠正到诊断的链接;随后设计结构化评测套件完成三元组排序与细粒度标签分类;最后以 LLM judge 对生成反馈做诊断覆盖与纠正有效性的 claim 级判定。相比以往仅做质量打分或描述的音乐评测,机制差异在于把可约束判断确定性评测与开放式反馈的 claim 覆盖分离,避免将专家分歧压缩为单一标量。在 515 段录音与 12 个音频大模型上的评测中,Qwen3.5-Omni Plus 的成对排序准确率达 74.5%,但所有模型细粒度 F1@3 最高仅 50.1% 且低于 62.4% 的多数类先验,严格诊断命中率均低于 7%。结论仅在英语独唱、单次音频输入且依赖专家提供时段的条件下成立,向多语言、多模态与交互式纵向辅导的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 把伦巴德效应拆成三层:说话人、音素与帧如何各管一摊
英文题目:ProLombard: Structured Multi-Scale Modeling for Normal-to-Lombard Speech Conversion
标签:#语音转换 | #向量量化 | #语音 | #多语言 | #高效推理
评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hongyang Chen:机构信息未在 arXiv HTML 中可靠披露
- Xinmeng Xu:机构信息未在 arXiv HTML 中可靠披露
- Youqiang Zheng:机构信息未在 arXiv HTML 中可靠披露
- Xingyu Liu:机构信息未在 arXiv HTML 中可靠披露
- Yuhong Yang:机构信息未在 arXiv HTML 中可靠披露
- Zhongyuan Wang:机构信息未在 arXiv HTML 中可靠披露
- Weiping Tu:机构信息未在 arXiv HTML 中可靠披露
- Song Lin:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
正常到隆巴德转换输入安静正常语音、输出噪声下高可懂度隆巴德风格语音,需保持语言内容、话者身份与语音质量,难点是隆巴德效应跨话语、音素、帧多时间尺度显现并与话者身份和音素内容纠缠,导致话者表示隆巴德泄漏与内容分离不全。第一步由对齐话者编码器负责以平行正常语音嵌入为参考做L1对齐加线性移除,输出风格无关话者向量,并将其传递给后续声学建模与波形解码以约束身份保持。第二步用于提取音素级内容表示,经向量量化离散化加中值帧聚合抑制平滑与量化伪影,并将所得音素表示送入帧级去隆巴德与激励隆巴德处理。第三步由帧级与音素级去隆巴德块负责剥离基频、响度、Alpha比等声学参数对应的隆巴德成分,净化后表示进入下一步等待风格回注。第四步由音素级与帧级激励隆巴德块融合目标隆巴德参数并生成增强表示,再经可学习上采样恢复帧率后将其送入类HiFi-GAN解码器输出波形,相对PGD-N2L等整体变换的关键差异在按层级对齐解耦与跨尺度剥离回注而非单尺度变换。在论文报告的评测设置下,本文方法相较PGD-N2L的LMUSHRA指标从61.41升至72.40,方向为更高。适用边界是:结论仅在普通话EMALG与英语Lombard Grid朗读式平行语料的正常到最高噪声级L80转换验证,与自然隆巴德仍有差距,未验证多样风格、动态声学环境与连续噪声控制外推。成本方面,相对骨干PGD-N2L参数量从30.99M增至32.79M、FLOPs从42.73G增至42.84G,额外开销为1.8M参数与0.11G FLOPs,未披露延迟与内存。
🔗 开源资源
第三方资源:https://github.com/leimao/Voice-Converter-CycleGAN — 暂时无法访问
第三方资源:https://github.com/liusongxiang/StarGAN-Voice-Conversion — 暂时无法访问
第三方资源:https://github.com/hs-oh-prml/DurFlexEVC — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 在标准 vLLM 上跑实时对话语音:GEPARD 把定制算子移出解码循环的取舍
英文题目:GEPARD - Generative, Prosody-aware, Autoregressive text-to-speech model for Realtime Dialogue
标签:#文本到语音 | #自回归模型 | #流式处理 | #实时处理 | #高效推理
评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.4/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Denis Pavlov:机构信息未在 arXiv HTML 中可靠披露
- Ulanbek Abdurazakov:机构信息未在 arXiv HTML 中可靠披露
- Nursultan Bakashov:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
实时对话要求模型以增量到达的文本为输入流式输出波形,输出需同时满足音质、韵律可控与极低首包延迟,难点在于自回归声学建模需在标准全注意力Transformer计算路径内实现稳定停顿预测与生产级吞吐。第一步负责声纹条件的提取,冻结的音频压缩器经L=2层Q-Former在预填充阶段一次性生成K=8个声纹token并以可学习null_prefix支撑无条件路径,其输出传递至主干前缀位置。第二步用于模态尺度对齐与融合,文本嵌入与经音频接口映射的NanoCodec GroupFSQ特征经仿射无关归一与尺度约束后拼接为[prefix|text|audio]序列并送入标准全注意力Transformer骨干,进入下一步自回归展开。第三步生成帧级离散码本,主干在音频区自回归并行预测C=32个独立FSQ通道的分类分布与二元停止头,每帧的32通道logits与停止概率进入下一步解码。第四步解码并输出波形,NanoCodec解码器将32通道码本直接合成为22kHz波形按块流式输出,并将两阶段分类器无关引导效应经偏好优化蒸馏至单遍权重以消除推理时双遍开销后传递至服务层。相对依赖残差向量量化与层内深度变换器的主流方案,该设计以GroupFSQ通道独立性假设换取与vLLM原生连续批处理和分页注意力的完全兼容,避免在解码循环内引入定制算子而保持高内存利用率与线性扩展。在论文报告的评测设置下,本文方法相较实时基线的Real-Time Factor指标达到0.067,方向为更低。适用边界是:结论仅在英语主导、3至10秒片段占主体的分布内成立,1至2词短指令易触发无限循环或漏词的失稳模式,多语种合成质量与基于WavLM的零样本说话人相似度仍有限且尚未经充分跨语种验证。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 以不完美证据约束自回归生成:码空间接地与局部精修如何兼顾忠实与自然
标签:#语音增强 | #自回归模型 | #向量量化 | #大语言模型
评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hao Shi:机构信息未在 arXiv HTML 中可靠披露
- Yuan Gao:机构信息未在 arXiv HTML 中可靠披露
- Zhaoheng Ni:机构信息未在 arXiv HTML 中可靠披露
- Junyi Peng:机构信息未在 arXiv HTML 中可靠披露
- Gongping Huang:机构信息未在 arXiv HTML 中可靠披露
- Yu Tsao:机构信息未在 arXiv HTML 中可靠披露
- Xugang Lu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音增强需从加性噪声观测恢复干净可懂语音,自回归生成虽能修复重度缺损却易产生观测不支持的幻觉内容,而确定性增强保留观测耦合证据但残留噪声与局部失真。第一步负责生成观测耦合证据,冻结Whisper引导的DPRNN输出确定性波形并与原始观测混合后分词为FSQ离散证据序列,将该证据传递给生成器作为条件。第二步用于生成观测支撑锚点,证据与连续Whisper特征共同条件化自回归干净语音token生成器,码空间接地按FSQ汉明距离惩罚偏离并送入自适应选择,进入下一步。第三步负责解码精炼输出自然波形,残差信噪比条件化接地按整句自适应选择接地强度并冻结应用,邻域精炼在锚点汉明球与大模型Top-K交集中重排并传递给合成后端。与无约束生成相比,该机制以分级距离兼容替代硬token匹配,只在小半径内允许修正而封堵大范围无支撑偏移,兼顾内容保真与感知质量。在论文报告的评测设置下,本文方法相较UD的WER指标从9.3%降至8.5%,方向为更低。适用边界是:结论限于LibriSpeech合成加噪与DNS无混响条件,混响等卷积失真尚未验证,极端尾部错误仍难完全纠正。成本方面,GNR-LLM需一次额外教师强制前向,相对SNR-CSG增加约2.5%解码开销,训练与部署成本披露不完整。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 用 125k 探针在 VAE 潜空间里拨动音高:扩散音乐生成的可控性不在自回归独占
英文题目:Pitch-class Steering for Diffusion-based Music Generation via Latent-space Probes
标签:#音乐生成 | #扩散模型 | #音乐 | #变分自编码器 | #测试时自适应
评分:6.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yushi Ye:机构信息未在 arXiv HTML 中可靠披露
- Wilson Zheng:机构信息未在 arXiv HTML 中可靠披露
- Yongyi Zang:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
文本到音乐生成中文本提示仅能提供风格等粗粒度控制,难以指定精确旋律序列,现有可控方法多针对自回归架构或需重训条件网络、需手写损失,对潜空间扩散模型的轻量细粒度音高控制仍缺乏。工作先在Stable Audio Open的变分自编码器(variational autoencoder, VAE)潜空间上训练帧级音高类别(pitch-class)探针,再将冻结探针作为可微损失在去噪采样中引导潜变量向目标音高序列偏移,通过基于pYIN基频跟踪的旋律一致性指标验证。与需重训的Music ControlNet或需手写损失的DITTO不同,该方法不修改基座模型与采样器,仅依赖探针梯度实现推理时转向,机制上近似分类器引导但采用与步数无关的噪声增强探针近似。在9种文本提示与3条目标旋律构成的27组试验中,最佳引导强度\(\lambda=0.05\)下旋律一致性相对无引导基线从0.112提升至0.274约2.4倍且差异高度显著(\(p=5.7\times10^{-6}\)),探针本身在验证集上微平均F1约0.663。结论目前仅在单基座模型、钢琴为主的单音乐器场景与音高类别层面得到验证,对复调织体、节奏与音区等更丰富音乐属性及跨模型泛化尚未检验。原文未披露训练、推理或部署成本,未提供代码与权重。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 声调与词义打架时,语音情感识别为何崩溃:TWIN-SER 基准与 DAS 解耦融合
英文题目:Robust Speech Emotion Recognition under Tone-Word Conflict: A Benchmark and Framework
标签:#语音情感识别 | #多模态学习 | #基准测试 | #鲁棒性
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Xiaojiang Peng:机构信息未在 arXiv HTML 中可靠披露
- Dawei Huang:机构信息未在 arXiv HTML 中可靠披露
- Yongjie Lv:机构信息未在 arXiv HTML 中可靠披露
- Ruijie Xiong:机构信息未在 arXiv HTML 中可靠披露
- Chunxiang Jin:机构信息未在 arXiv HTML 中可靠披露
- Bin Li:机构信息未在 arXiv HTML 中可靠披露
- Xiaohui Wang:机构信息未在 arXiv HTML 中可靠披露
- Zitong Yu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
语音情感识别 Speech Emotion Recognition / SER 需从语音推断说话人真实情感类别,难点在于真实场景中声学韵律与词汇语义经常矛盾,现有模型在二者一致时有效而在讽刺、冷怒等冲突下崩溃。本文方法链分三步:异构特征提取分别用生成向音频分词器与识别向语音编码器得到解耦的声学与语义流并做块平均池化,显著块选择以 L2 能量选出稀疏高激活情感片段并投影到统一维度,基于查询的融合模块以可学习查询交叉注意力动态加权双路上下文后经多层感知机 Multilayer Perceptron / MLP 预测七类情感。与纠缠表征或语义偏置基线相比,关键差异是显式双路解耦加稀疏选择再融合,使模型在冲突时可抑制不可靠模态。在 TWIN-SER 冲突基准上解耦声学语义融合 Disentangled Acoustic-Semantic fusion / DAS 以加权准确率 Weighted Accuracy / WA 59.38% 超过最强基线 Whisper 的 47.26%,在 ESD 上亦保持竞争力。结论仅适用于中英两语、7 类离散情感的短句合成冲突语音,对恐惧与厌恶等少样本微妙情感仍失效。原文未披露训练时长、推理延迟或部署成本。
🔗 开源资源
代码相关资源:https://github.com/24DavidHuang/FAS — 暂时无法访问
数据相关资源:https://github.com/24DavidHuang/FAS — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 无语音却有文本:用门控低秩投影在解码器表示层抑制 Whisper 幻觉
英文题目:Reducing Hallucinated Transcripts in Whisper via Hallucination Space Projection
标签:#语音识别 | #测试时自适应 | #鲁棒性 | #语音活动检测
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Maryam Abbasihafshejani:The university of Texas at San Antonio
- Murtuza Jadliwala:The university of Texas at San Antonio
📌 核心摘要
Whisper 等生成式自动语音识别(Automatic Speech Recognition, ASR)模型在无语音输入下易产生流畅但虚假的转写,正确输出应为空而任何非空文本即为幻觉,难点在于同一自回归解码器同时负责文本生成与无语音概率估计。方法分三步:先在 ESC-50 非语音标定集(folds 1-3,1200 条)上按是否幻觉分组采集解码器隐状态,再对幻觉与正确拒绝样本的差值矩阵做 SVD 提取前 r 个右奇异向量构成低秩幻觉子空间,最后在推理时以门控方式将隐状态正交投影出该子空间并二次解码。干预发生在无语音概率决策之前而非阈值之后,无需参数更新。与依赖外部语音活动检测(Voice Activity Detection, VAD)或词表后过滤的基线不同,该方法在表示层直接抑制幻觉方向。关键结果上,跨 3 模型尺度×3 非语音集的平均 HR 从 31.31% 降至始终投影 2.44%(相对降低 92.21%)和门控 3.74%(相对降低 88.05%);单看 Whisper large-v3 时 3 非语音集平均 HR 从 47.23% 降至门控 4.09% 与始终投影 0.85%,UrbanSound8K 上从 76.08% 降至 2.74%,且标定仅来自 ESC-50 显示跨声学场景复用;代价是 LibriSpeech 上门控带来 0.33 至 4.39 个百分点的 WER 上升与 0.41% 至 9.97% 的 FRR。结论仅适用于非语音幻觉场景,对长音频、模糊语音等未验证。原文未量化二次解码的时延与吞吐开销。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 什么在挑选、什么在重建:当变形类能插值时选择为何失效
英文题目:What Selects, What Reconstructs: Repairing Exemplar-Based Complex-Spectrum Separation
标签:#音乐源分离 | #形式化分析 | #音乐 | #时频分析
评分:6.8/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Maxime Baelde:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
单通道单帧复频谱分离输入为混合频谱、输出为各声源复谱估计,难点在于同一形变类既要选对字典原子又要重建相位,当形变可插值时残差判据退化为正则项排序且估计求和回混合。第一步负责揭示退化机理,用于逐频点自由形变检验插值条件并生成退化诊断,诊断结果传递至选择类设计。第二步用于刚性选择,负责对每原子施加1个复增益与1个纯时延共3个实参数的约束并提取能量归一化匹配滤波得分,得分排序后送入重建阶段。第三步负责联合重建,用于在已对齐的每声源top-k原子上作复最小二乘拟合并输出估计,可选按能量比例回吸收残差进入下一步最终合成。与已有复谱样例法共用同一自由形变类兼任选择与重建不同,本文强制选择类更贫瘠而重建类更丰富,使选择恢复残差信息且重建免于迭代搜索。在论文报告的评测设置下,本文方法相较Def-MAP的Δmix指标从+5.71 dB升至+6.11 dB,方向为更高。适用边界是:仅人声可声称样例分离且伴奏容量在纯模型下低于混合,结论限于MUSDB18 50首5秒摘录1024点半窗Hann STFT单帧设置且选择对混合打分导致容量随k增大被吞噬。成本方面,单帧推理时延在100原子/源时约10.7 ms、较原法降低47至806倍,测量于单核AMD Ryzen 7 7435HS未优化numpy实现且原文未披露训练成本。
🔗 开源资源
代码相关资源:https://github.com/mbaelde/defmap-repair — 暂时无法访问
复现相关资源:https://github.com/mbaelde/defmap-repair — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 多人声场叠加下如何用声音同时还原三维姿态:SoundMHPE 的多尺度与时序解耦
标签:#声源定位 | #注意力机制 | #时频分析 | #数据集
评分:6.8/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yusuke Oumi:Keio University, Yokohama, Kanagawa 223-8522, Japan
- Yuto Shibata:Keio University, Yokohama, Kanagawa 223-8522, Japan
- Go Irie:Keio University, Yokohama, Kanagawa 223-8522, Japan;Tokyo University of Science, Katsushika, Tokyo 125-8585, Japan
- Akisato Kimura:NTT, Inc., Keihanna Science City, Kyoto 619-0237, Japan
- Yoshimitsu Aoki:Keio University, Yokohama, Kanagawa 223-8522, Japan
- Mariko Isogawa:Keio University, Yokohama, Kanagawa 223-8522, Japan
📌 核心摘要
任务以主动声学感知采集的四通道声信号为输入,输出多人连续 3D 人体姿态序列,难点在于多人运动引起的声学扰动在时频域叠加且存在人体间二次反射导致的传播延迟,难以将观测变化归因到个体。方法链分三步:先对接收信号做多尺度短时傅里叶变换(Short Time Fourier Transform, STFT)生成不同时间分辨率与频率分辨率的对数梅尔频谱(log-Mel spectrogram),再经声学多尺度编码器(Acoustic Multi-scale Encoder, AME)以时序自注意力与频域自注意力解耦时间依赖与多分辨率频域关系得到声学特征图,最后由时序姿态解码器(Temporal Pose Decoder, TPD)为每人分配多帧姿态查询与实例查询,通过运动自注意力与交互自注意力联合建模个体内时序演化与个体间相互影响并经交叉注意力从特征图中提取帧级姿态。与单查询压缩整段时序的 DETR 式基线不同,该设计让每帧查询对齐对应时段声学特征,避免时间维度坍缩。在声学多人姿态(Acoustic Multi-person Pose, AMP)数据集的三折跨被试评估中,SoundMHPE 以 MPJPE 106.5 mm 优于最强声学基线 119.9 mm 与 WiFi 基线 119.9 mm,PA-MPJPE 与 PCKh@0.5 亦同步提升。结论仅在受控室内、固定扬声器与麦克风布局及有限人数与动作分布下验证,对强混响、环境噪声、遮挡材质多样性及未见人数的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://oumi03.github.io/sound-mhpe/ — 链接可访问(HTTP 200)
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. SDR 相同的鼓声,听感位置却不同:分离模型如何重塑攻击与动态
英文题目:Beyond SDR: How Music Source Separation Reshapes Rhythm-Relevant Signal Properties
标签:#音乐源分离 | #评测协议 | #音乐 | #统计分析
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Chuxin Ding:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该任务输入为混合音乐、输出为鼓组等分轨,难点在于全局重建保真度与节奏分析所需的起音形态和动态包络并不一致。第一步负责用四代开源分离器重建分轨并缓存结果,再传递分离后鼓组给双族指标计算。第二步用于并行计算开发者族重建误差与分析者族起音检出和动态轮廓,并送入跨模型对照以定位失真落点。第三步提取固定乐段在不同输入长度下的渲染漂移并输出稳定性度量,进入下一步与前两步证据融合形成方法学判断。与已有榜单只报告重建误差的做法相比,该设计把感知时间位置的形态依赖显式纳入评测,因而能揭示榜单排序与瞬态保真排序的背离。在论文报告的评测设置下,本文方法相较SCNet-XL的|Δ attack-slope|指标从0.64升至1.33,方向为更高。适用边界是:结论仅适用于所测四模型与西方流行摇滚语料及鼓组中心分析,不支持向人声或主观听感直接外推。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/dingchuxin/MSS-eval — 暂时无法访问
代码相关资源:https://github.com/dingchuxin/MSS_drum_fidelity_eval — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 压缩导向的语音编码为何不适合直接做自回归建模:ARDDS 的正则与异构降采样重对齐
英文题目:Rethinking Speech Codecs: From Compression to Autoregressive Generative Modeling
标签:#语音编码 | #自回归模型 | #向量量化 | #语音
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yazheng Yang:†\dagger The University of Hong Kong, ‡\ddagger Meituan Inc.China
- Yao Qiu:†\dagger The University of Hong Kong, ‡\ddagger Meituan Inc.China
- Hui Su:†\dagger The University of Hong Kong, ‡\ddagger Meituan Inc.China
- Qi Liu:†\dagger The University of Hong Kong, ‡\ddagger Meituan Inc.China
📌 核心摘要
本文处理将16 kHz连续语音波形离散化为多层离散码序列以供大语言模型自回归建模的任务,输入为原始波形、输出为每时间步多码本整数序列,难点在于传统编解码器仅优化率失真与感知质量,码流时序可预测性不足且帧率显著高于文本导致跨模态对齐困难。第一步负责将波形通过卷积编码器提取低帧率隐变量并经残差向量量化或有限标量量化生成离散码本索引并由解码器重建波形,其输出的量化前隐变量与软量化分布被传递至下一步以供正则约束。第二步用于对软量化分布施加自回归可预测性正则,由6层Transformer解码器以温度0.01的softmax近似可微地生成下一码元预测并计算预测损失,其塑造后的可预测码流被送入下一步进行时序对齐。第三步负责对不同码本层实施异构降采样,将承载语义的首层降至6.25 Hz、其余声学层保持12.5 Hz以对齐文本节奏并缩短序列,其输出的异构帧率码流进入下一步与文本token拼接供LLaMA-3 8B进行延迟模式的交错建模。与仅采用因果卷积保证时序因果性的已有编解码器不同,该框架在训练目标层面显式塑造类语言的时序一致性与可预测分布而非事后适配,使语义码流在节奏上更接近文本,从而提升大模型续训效率与生成连贯性。在论文报告的评测设置下,本文方法相较XCodec的StoryCloze指标从63.7%升至70.1%,方向为更高。适用边界是:结论在LibriSpeech与Common Voice中文子集训练的XCodec等码本量化编解码器及约40万小时中文语料续训的SpeechLM上验证,当首层帧率进一步降至3 Hz时量化承诺损失剧烈波动导致训练不稳定,跨采样率、跨语种与流式部署的外推尚未验证。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 联合分支不可全信:用冲突量与可干预性重配解码权重
标签:#音视频问答 | #测试时自适应 | #音视频 | #多模态模型
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yuchen Deng:机构信息未在 arXiv HTML 中可靠披露
- Chang Sun:机构信息未在 arXiv HTML 中可靠披露
- Hai-Tao Zheng:机构信息未在 arXiv HTML 中可靠披露
- Feidiao Yang:机构信息未在 arXiv HTML 中可靠披露
- Yuxing Han:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全模态大语言模型以音频、视频与文本查询为输入并输出问答预测,难点在于联合音频-视频分支偏离单模态证据时既可能是有害干扰也可能是有益互补,若不区分兼容性而直接压制融合会损伤互补推理。第一步,潜在冲突幅度估计负责度量音频分支、视频分支与联合分支的预测分歧并生成潜在冲突幅度C,该输出进入下一步作为是否干预的幅度门控。第二步,冲突可干预性评估用于在任务答案空间以查询相关性与答案决断性为可靠性证据提取干预方向,其结论送入权重调整环节并与C共同决定转移条件。第三步,冲突感知加权解码负责将可干预冲突下的解码权重从联合分支融合再分配至单模态分支并输出最终预测,该调整传递至逐词元解码过程以抑制不可靠融合。与均匀扰动的音频视频对比解码和仅按查询相关性加权的模态自适应解码不同,CAD显式区分相关性与兼容性并保留互补融合,实际意义在于只在有可靠证据时削弱联合分支。在论文报告的评测设置下,本文方法相较原始解码策略的Overall Acc指标从70.9%升至85.0%,方向为更高,该结果来自CMM上Qwen2.5-Omni-7B对照。适用边界是:结论限于多选与二分类音视频问答解码,对开放式生成和强互补推理的外推尚未验证。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/conviction6/CAD — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 从听见写入选项到用选项做决定:音频大模型中声学证据的两阶段路径
英文题目:Tracing Audio Grounding and Answer Selection in Audio LLMs
标签:#音频问答 | #注意力机制 | #LoRA | #可解释性 | #音频大模型
评分:6.7/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Hyebin Cho:机构信息未在 arXiv HTML 中可靠披露
- Suho Yoo:机构信息未在 arXiv HTML 中可靠披露
- Jihoo Jung:机构信息未在 arXiv HTML 中可靠披露
- Joon Son Chung:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
音频问答任务输入为音频、问题与候选选项,输出为选项字母,难点在于模型易依赖文本先验而非声学证据导致高分与真实听觉接地脱节,难以量化训练是否真正让声学决定答案。第一步负责构造行为敏感度检验,用于量化声学依赖,将静音与错配音频替换后的准确率落差计算为敏感度并传递至下一步对比训练前后变化。第二步用于定位信息流,负责阻断注意力,分别切断音频到选项与选项到答案的跨层连接,测量正确选项概率变化并将层段重要性分布送入下一步。第三步负责检验参数更新的功能作用,用于按层段禁用或单独训练LoRA增量,验证特定层带对性能的必要性与充分性并传递至下一步输出分阶段机制结论。与仅报告准确率提升的已有方法不同,该链路将行为变化归因到早期到中期层融合声学以塑造选项表征、中期到后期层解码选项表征用于最终预测,揭示了声学接入与决策利用的分工意义。在论文报告的评测设置下,本文方法相较零样本Qwen2-Audio的准确率指标从36.9%升至51.1%,方向为更高。适用边界是:结论仅在多选题、短音频(截断至30秒)与Qwen2-Audio/Qwen2.5-Omni上验证,长音频、开放式问答及跨架构外推尚未检验且MMAU上出现负迁移。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 一步到位改三维声场:SwanWeave 为何把事件、空间、运动与房间一起学
英文题目:SwanWeave:One-Stage Multi-Task Instruction-Guided 3D Spatial Audio Editing
标签:#空间音频渲染 | #混合专家模型 | #空间音频信号 | #偏好优化 | #流匹配
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Ke Lei:Zhejiang University
- Chenyuhao Wen:Zhejiang University
- Yu Zhang:ByteDanceEqual contribution
- Wenxiang Guo:Zhejiang University
- Changhao Pan:Zhejiang University
- Sashuai Zhou:Zhejiang University
- Yongshi Li:Zhejiang University
- Ruiqi Li:ByteDanceEqual contribution
- Ruofan Hu:Zhejiang University
- Haorui Xu:Zhejiang University
- Xiang Yin:ByteDanceEqual contribution
- Zhou Zhao:Zhejiang University;Corresponding author
📌 核心摘要
该工作处理指令引导的3D一阶Ambisonic空间音频编辑,输入为4通道FOA源波形与自然语言指令,输出为执行编辑后保留无关事件与房间特性的目标FOA,难点在于事件语义、方位/距离、时变轨迹与混响在波形层面强耦合且需一阶段完成复合指令的联合声学变换。第一步负责从开源语音与音效语料通过可控房间仿真生成源-指令-目标三元组及场景字幕,用于提供成对监督,生成的数据传递至下一步的表征学习。第二步用于在FOA变分自编码器潜空间以扩散Transformer做条件流匹配编辑,将源潜变量与加噪目标拼接并通过交叉注意力融合指令条件,得到的潜编辑结果送入下一步的专家路由。第三步负责以空间编辑混合专家实现双层路由,其中任务级路由用于复合指令的专家组合选择而帧级路由与空专家用于局部编辑决策,路由后的特征进入下一步的偏好对齐。第四步用于以空间偏好优化对错误编辑与无操作负样本做直接偏好优化对齐并配合阶梯式分类器无关引导,优化后的潜变量传递至解码器解码输出最终FOA波形。与现有通用编辑器相比,关键差异在于直接学习复合指令的一阶段源到目标变换而非串行执行原子操作,并在潜空间显式分离任务与局部路由以减少重建与空间误差的累积。在论文报告的评测设置下,本文方法相较SmartDJ的FD指标从8.47降至5.47,方向为更低。适用边界是:结论在基于PyRoomAcoustics的合成鞋盒房间与受控仿真分布内验证,对真实录音、遮挡与不规则房间响应的泛化尚未检验。成本方面,推理单样本平均耗时1.17秒优于SmartDJ的4.23秒,原文未披露训练硬件配置与总时长细节。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 把级联状态机装进大模型:TurnFSM 如何串行做提交与拒绝
标签:#轮次切换 | #状态空间模型 | #流式处理 | #语音 | #大语言模型
评分:6.4/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Zhiwei Lin:机构信息未在 arXiv HTML 中可靠披露
- Tianjiao Du:机构信息未在 arXiv HTML 中可靠披露
- Qiaochu Huang:机构信息未在 arXiv HTML 中可靠披露
- Zihan Zhang:机构信息未在 arXiv HTML 中可靠披露
- Naijun Zheng:机构信息未在 arXiv HTML 中可靠披露
- Longshuai Xiao:机构信息未在 arXiv HTML 中可靠披露
- Yunfei Lu:机构信息未在 arXiv HTML 中可靠披露
- Jun Chen:机构信息未在 arXiv HTML 中可靠披露
- Zhiyong Wu:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
全双工语音助手需在系统发声的同时持续监听,输入为混有回声、背景人声与环境噪声的流式音频,输出为提交时机与接受或拒收决策,难点在于低延迟流式约束下语义完整性与输入有效性判据异构且易互相干扰。TurnFSM先由流式音频编码器与适配器将声学帧映射为大语言模型音频token,再由大语言模型以上一状态为条件预测当前有限状态,串行完成监听阶段语义提交判断与提交后有效性判断。与同骨干并行双头相比,该机制将异构判据解耦到不同状态阶段并用一阶依赖消除历史状态累积。在内部800条语义端点检测测试上TurnFSM成功率为82.41%,超时率为5.53%,成功平均延迟为80.9 ms,优于同骨干双头基线并接近单任务模型。在内部3K条拒收测试上误接受率为3.35%,误拒绝率为16.04%,略优于单任务拒收模型。在EasyTurn话语级完整性测试上总准确率为91%,高于TEN与Smart Turn但落后Easy Turn约6个百分点。该结论限于中文为主的内部数据与模拟流式评测,未验证强重叠打断与跨语言泛化。原文未披露训练时长、推理吞吐与部署成本。
🔗 开源资源
- 第三方资源:https://github.com/pipecat-ai/smart-turn — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 语音不只是文字的喇叭:温暖介导伤害为何必须同时审听觉与文本
英文题目:Probing Warmth-Mediated Harm in Speech-Enabled LLMs for Mental-Health Conversations
标签:#语音对话系统 | #评测协议 | #统计分析 | #主观评测 | #语音
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
👥 作者与机构
- Eugenia Kim:Microsoft, Redmond, WA, USA
- Bolor-Erdene Jagdagdorj:Microsoft, Redmond, WA, USA
- Dina Pekelis:Microsoft, Redmond, WA, USA
- Leah Zulas:Microsoft, Redmond, WA, USA
- Amanda Minnich:Microsoft, Redmond, WA, USA
📌 核心摘要
该任务输入为连续7轮情感递增的用户披露话语与WHO mhGAP指南锚定的安全要求,输出需同时判定文本回复是否承诺依恋陪伴或角色替代以及合成语音是否以温暖韵律强化该承诺,难点在于温暖的伤害需跨轮次累积且文本转录会抹去声音的关系信号。第一步负责基于WHO mhGAP的9类主诉编写38个固定7轮脚本并标注安全要点,生成的结构化脚本传递至语音合成环节进入下一步。第二步用于通过Azure Neural TTS以单一女声及悲伤风格将用户侧统一合成为语音并随情感强度递增,该音频送入同一gpt-realtime模型进入下一步。第三步负责在音频与纯文本两种条件下生成回复并用Whisper回补缺失转录,得到的配对文本与24kHz波形传递至评分阶段进入下一步。第四步用于以GPT-4o判别器提取文本温暖度与关系承诺分数并用librosa提取时长、语速、基频、能量等韵律特征辅以人耳验证,输出模态配对的温暖中介伤害度量。与仅测理解与对话质量的音频基准不同,该工作将温暖视为可度量中介伤害并强制单模型音频文本配对比较,使转录不可见的语音变冷与高风险条件集中差异得以暴露。在论文报告的评测设置下,本文方法相较音频条件的parasocial commitment接受率指标从58%升至63%,方向为更高。适用边界是:结论仅适用于单模型gpt-realtime、单TTS声线与脚本化披露,未验证真实用户语音、跨模型泛化与临床安全性,且诱发轮每条件样本仅3至8例限制条件级推断。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 用可学习的分组有理激活替换固定激活:KanAdapter 在语音基座模型上的并行瓶颈适配
标签:#说话人验证 | #Adapter | #音频深度伪造检测 | #语音情感识别 | #语音
评分:6.4/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Phuong Tuan Dat:Dept. of Electrical and Computer Engineering, National University of Singapore
- Phuong Khai Minh:School of Computing, National University of Singapore
- Tran Huy Dat:Institute of Advanced Intelligence and Computing (IAIC), ASTAR
📌 核心摘要
语音基础模型需在冻结大规模自监督编码器前提下,仅以少量可训练参数将通用语音表征适配至说话人验证、语音情感识别与深度伪造检测等分类输出,难点在于固定激活的多层感知机瓶颈在紧凑预算下表达受限且跨任务更新易引发遗忘。为此KanAdapter构建并行瓶颈适配链,第一步负责对当前Transformer层中间特征进行层归一化并经下投影压缩至128维瓶颈,生成低维表征并传递至下一步。第二步用于在瓶颈内经分组有理可学习激活的GR-KAN进行非线性变换,提取灵活的单变量有理映射特征并送入下一步。第三步负责经上投影还原至原始维度并以可学习缩放因子与冻结MLP分支残差融合,输出适配后特征进入下一步的后续层,仅更新适配器参数而保持主干冻结。相较固定ReLU的AdaptFormer与无非线性的LoRA,GR-KAN在边上提供分组共享的可学习有理函数,以常数级额外参数提升逼近能力并利用局部支撑缓解跨任务干扰,具有更强的参数效率与抗遗忘意义。在论文报告的评测设置下,本文方法相较AdaptFormer的Equal Error Rate指标从1.44%降至0.52%,方向为更低。适用边界是:该优势在24层深模型如WavLM Large与XLSR-Large上最稳定,对12层浅模型如UniSpeech-SAT与mHuBERT-147差距扩大,且仅在分类任务上验证,对语音识别等序列生成任务及更长连续学习序列尚未验证。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 长时音视频为何不能只靠分块拼接:Encore 用参考锚点与自适应信号路由维持一致性
英文题目:Encore: Infinite Audio-Video Generation with Adaptive Signal Routing
标签:#音视频生成 | #注意力机制 | #长音频处理 | #音视频
评分:6.3/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Shaohua Pan:Baidu, China
- Junbao Chen:Beijing Institute of Technology, China;Baidu, China
- Shengyi He:Baidu, China
- Jingfeng Xue:Beijing Institute of Technology, China
- Wen Tao:Baidu, China
- Haocheng Feng:Baidu, China
- Siming Fan:Baidu, China
- Dongwei Pan:Baidu, China
- Yi Yang:Baidu, China
- Wei He:Baidu, China
- Hang Zhou:Baidu, China
📌 核心摘要
该任务以文本、参考音视频为输入,输出任意时长的同步语音与高分辨率视频,难点在于同时维持视频时序连贯、音频时序连贯与跨模态唇音同步,且三类条件信号通过不同通路注入易相互干扰。Encore以LTX-2.3为短片段生成器,先用带参考偏移旋转位置编码(RoPE)的全局锚点与带误差回收的局部延续上下文构建分块迭代管线,再由自适应信号路由(Adaptive Signal Routing,ASR)在自注意力中对锚点与延续列加可学习偏置、在交叉注意力中对文本与音视频同步分支输出加可学习缩放,实现逐层逐头的动态加权。相比将所有条件等权处理的短片段音视频模型与仅做无声长视频的迭代方法,该路由机制显式区分了全局身份与局部时序的职能差异。在30秒长音视频基准上,Encore的身份一致性达0.86、唇同步置信度LSE-C达2.36,均显著优于最强基线,且时序漂移指标大幅降低。该结论目前仅在扩展VerseBench的受控场景与固定参考帧假设下验证,复杂转场与开放域长叙事的外推尚未检验。原文未披露训练、推理或部署成本。
🔗 开源资源
代码相关资源:https://github.com/shaohua-pan/Encore — 暂时无法访问
数据相关资源:https://github.com/shaohua-pan/Encore — 暂时无法访问
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 在连续隐空间里一次生成一小段:SCAPES 如何用语义嵌入控制环境声纹理
英文题目:SCAPES: Semantically Conditioned Autoregressive Prior for Environmental Sounds
标签:#音频生成 | #流匹配 | #环境声 | #自回归模型 | #低资源
评分:6.2/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:模型报告 | arXiv 原文
👥 作者与机构
- Esteban Gutiérrez:机构信息未在 arXiv HTML 中可靠披露
- Lonce Wyse:机构信息未在 arXiv HTML 中可靠披露
- Frederic Font:机构信息未在 arXiv HTML 中可靠披露
- Xavier Serra:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
环境声合成的输入是稀疏高层语义意图,输出是长时间高保真立体声纹理,实际难点在于语义描述粗糙而波形稠密,且随机纹理既需多样变化又需长期稳定不漂移。第一步负责将重叠音频片段经冻结的48kHz立体声EnCodec连续潜空间编码为原子并保留全局增益尺度,编码结果传递给后续条件建模。第二步用于以CLAP语义上下文嵌入为全局条件、以前序5个原子为记忆,由Transformer参数化的连续归一化流经流匹配学习目标原子的向量场,该向量场送入推理阶段求解。第三步生成时从高斯噪声出发逐原子求解常微分方程得到新原子,并将新原子输出进入下一步的重叠相加与0.02s交叉淡化递归拼接为连续长纹理。与离散残差向量量化词表自回归相比,该机制保留潜流形连续性并以10Hz语义注入实现细粒度引导,避免量化割裂导致的刚性约束。在论文报告的评测设置下,本文方法相较目标上下文嵌入的Cosine Similarity(CLAP)指标达到0.93±0.02,方向为更高。适用边界是:结论适用于10类短记忆随机环境纹理的重合成与长时稳定生成,对语音与复调音乐等长程结构失效,且未在外部大规模语料验证。成本方面,约36M参数模型在单张消费级GPU上以约两倍源音频时长完成训练,推理采用多步常微分方程求解。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 猜对不算懂:用选项重排伪集成让音乐问答模型学会拒答
英文题目:Knowing When Not to Answer: Pseudo-Ensembles for Abstention in Music Audio-Language Models
标签:#音频问答 | #模型集成 | #音乐 | #音频大模型 | #模型评估
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Aanya Maheshwari:Jumeirah College, Dubai
- Vatsal Raina:Apta AI, Spark AI Research
📌 核心摘要
音乐音频语言模型在多项选择音乐问答中以录音加问题加四个候选项为输入并输出唯一选项符号,强制作答使蒙对与真懂混同,而单次预测分布的熵无法区分数据歧义与模型无知,因而难以可靠拒答。第一步负责构造分类读数,用于从首词元受限词表上提取各选项符号的概率分布,并将其传递给后续集成构造。第二步负责生成答案保持扰动,用于对同一冻结模型施加选项顺序混洗得到多个成员分布,并将其送入对齐平均环节。第三步负责融合多成员信息,用于对齐平均后生成期望分布并计算期望熵等不确定性分数以输出拒答排序,并将该排序进入下一步阈值决策。与仅用单次熵度量总量的做法不同,伪集成以输入视角分歧近似参数集成差异,从而同时提供总量与分歧信号并顺带抵消位置偏置,具有可直接部署的实际意义。在论文报告的评测设置下,本文方法相较单次通过熵基线的AUC-ERC指标从0.293降至0.261,方向为更低。适用边界是:结论仅在TinyMU单检查点与MuChoMusic四选一首词元读数下成立,若未来模型对选项顺序不变或转向自由生成则分歧信号可能失效。成本方面,每题需四次前向推理且无需重训练,额外开销随成员数线性增长。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 低码率语音编解码装不下时:用语义与唇动补上高层信息
英文题目:Enhancing Neural Speech Coding with Semantic and Visual Cues
标签:#语音编码 | #多模态学习 | #知识蒸馏 | #注意力机制 | #音视频
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Yao Guo:机构信息未在 arXiv HTML 中可靠披露
- Yang Ai:机构信息未在 arXiv HTML 中可靠披露
- Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露
- Xiao-Hang Jiang:机构信息未在 arXiv HTML 中可靠披露
- Chen-Yuan Ning:机构信息未在 arXiv HTML 中可靠披露
- Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
低码率语音编码输入语音波形或MDCT谱并输出紧凑离散码再重建语音,难点在于有限码容量需同时保留内容韵律音色与细节,仅靠语音自身表征易丢失高层上下文与构音信息。第一步负责从下采样语音经WavLM提取上下文语义表征并经语义编码器压缩重建监督,其输出传递进入下一步的跨模态融合。第二步用于从64×64唇图序列经图像分析器提取构音运动视觉特征并以图像合成重建约束,其输出送入同一融合模块等待对齐。第三步负责以视觉特征为查询、语义特征为键与值经交叉注意力融合生成双模态高层表征,并送入语音编码器第三个MCNX块后经拼接注入或蒸馏约束后解码输出重建语音。与单模态增强或简单拼接不同,该定向查询融合与融合蒸馏双路径分别适配有无辅助输入的推理场景。在论文报告的评测设置下,本文方法相较MDCTCodec的ViSQOL指标从3.86升至4.01,方向为更高。适用边界是:结论仅在TaL80的48kHz英语朗读视听数据验证,未检验噪声混响跨语言跨视角或缺帧唇图下的鲁棒性。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 混语口述史里英文指标最好的一档,为何恰恰丢掉了非英语片段
英文题目:Automatic Speech Recognition for Multilingual Oral History Research
标签:#语音识别 | #数据集构建 | #多语言 | #语音 | #模型比较
评分:5.5/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:应用研究 | arXiv 原文
👥 作者与机构
- Sidney Wong:机构信息未在 arXiv HTML 中可靠披露
- Chelsea Wong She:机构信息未在 arXiv HTML 中可靠披露
- Eda Tang:机构信息未在 arXiv HTML 中可靠披露
- Tiana Marshall Wong:机构信息未在 arXiv HTML 中可靠披露
- Debbie Sew Hoy:机构信息未在 arXiv HTML 中可靠披露
- Chelsea Wong:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
本文输入为新西兰粤语长者英语粤语台山话毛利语混杂口述史录音,输出为可编辑首遍转写稿,难点在于句内语码转换、粤语口语与标准书面中文的双层差异及台山话音系变体缺乏标注。第一步由社区团队负责采集五人语料并完成伦理归档,所获双轨录音传递至预处理。第二步用于叠加音频处理,用FFMPEG加PYDUB将双麦克风双轨叠加为单轨长音频,并送入预训练推理。第三步用于复用Whisper预训练权重在英语指定与语言未指定条件下生成转写,并将预测文本传递至JiWER评价进入下一步的语义抽查。相对已有单语基准评测的关键机制差异在于将语言检测与非英语转写失败本身作为评价对象,揭示低词错率以误判主语言为毛利语及拼音式转写为代价,具有首遍草稿实用意义。在论文报告的评测设置下,本文方法相较英语指定LARGE-V2的WER指标从17.78%降至12.10%,方向为更低。适用边界是:结论仅适用于英语为主的首遍草稿场景,台山话区分与非英语忠实繁体转写尚未解决且仍需人工校对。成本方面,全库12小时42分钟音频端到端耗时5小时,约为508小时人工转写估计的1%,不含校对时间。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 记忆即变换:LETHE 用能量判别与随机扰动让混响参数自己走
英文题目:Memory as transformation: LETHE, a self-referential gan-inspired architecture
标签:#音乐生成 | #强化学习 | #信号处理 | #开源工具
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
排名:前50% | 文档类型:系统技术报告 | arXiv 原文
👥 作者与机构
- Francesco Vitucci:机构信息未在 arXiv HTML 中可靠披露
- Anthony Di Furia:机构信息未在 arXiv HTML 中可靠披露
- Francesco Scagliola:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该工作处理无外部数据集的持续声音变换,输入为初始录音或实时信号,输出为经自改写循环不断演化的声音,难点在于不可微实时系统中如何定义可执行的自我评价目标。第一步由3×3反馈延迟网络负责变换与重写循环缓冲,其输出传递至包络跟随器进入下一步。第二步由包络跟随器用于提取10Hz能量并生成五维特征,该特征被送入单感知机判别器进入下一步。第三步由判别器负责对比当前状态与暖机存档初始能量分布并输出相干性评分,该评分传递至扰动优化器进入下一步。第四步由单样本扰动优化器负责生成参数扰动并用于更新矩阵系数与延迟时间,其更新结果传递回反馈延迟网络形成闭环。相对经典生成对抗网络,该机制用初始能量存档替代外部真实分布,用随机扰动估计替代反向传播,从而在非平稳归一化下维持闭环可运行。在论文报告的评测设置下,本文方法相较固定消融组的Δ base c22指标从0.000升至+0.102±0.067,方向为更高,评测采用5种合成信号、固定与循环条件、每场180s共45场会话。适用边界是:结论仅适用于能量相干性判据与短时合成素材,尚未验证频谱判据、长时稳定性与人声感知效果。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
37. 终点相同不等于负担相同:语音客服审计为何要先过验证门
标签:#语音对话系统 | #评测协议 | #公平性 | #语音
评分:5.3/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.3/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后 50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Vignesh Ethiraj:机构信息未在 arXiv HTML 中可靠披露
- Ashwath David:机构信息未在 arXiv HTML 中可靠披露
📌 核心摘要
该文处理语音客服服务情节审计,输入为多轮呼叫者语音、对话状态与工具调用轨迹,输出为终端服务结果与路径负担判定,难点在于口音情感等呈现线索、状态记忆与工具权限交织,且伤害常以额外修复负担出现在最终答复之前。第一步负责锁定退款争议等服务场景与账户、政策、资格等不变服务事实并哈希签名,其锁定输出传递给配对条件构造。第二步用于生成口音、情感与流利度受控的配对呼叫者条件并保持语言内容恒定,其配对语音送入验证环节审查。第三步提取七道验证门后的终端结果、路径负担、工具行为等六族指标并生成配对增量,其增量结果进入下一步的权利主张判定。相对已有语音识别公平性与语音智能体能力基准的关键差异在于以情节为证据单位,并区分原生端到端、级联与混合工具架构的可观测伪影,从而分离识别误差与服务负担路径。在论文报告的评测设置下,全合成演示REF-001-v1.2中条件cb相较条件ca的Repair指标从1升至3,方向为更高。适用边界是:该全合成演示仅支持构造有效性,跨人群泛化、厂商比较与真实流量结论均被明确排除且尚未验证。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
38. 线性拼接已够好时,注意力还能补什么:BioSync 的宽深融合与合成验证
英文题目:BioSync: Transformer-Based Cross-Modal Fusion for a Multimodal Physiological Digital Biomarker
标签:#病理语音评估 | #多模态学习 | #语音生物标志物 | #生理信号 | #语音
评分:4.4/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.3/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后 50% | 文档类型:方法研究 | arXiv 原文
👥 作者与机构
- Seyed Mahmoud Sajjadi Mohammadabadi:Department of Computer Science and Engineering, University of Nevada, Reno, 1664 N. Virginia St., Reno, 89557, NV, USA
📌 核心摘要
本文处理可穿戴连续监测中的多通道生理建模,输入为心率变异性、定量脑电、腕动计与语音等异构摘要特征,输出为连续复合生物标志物生物同步指数与被试级模态权重,难点在于通道噪声随被试与会话变化且联合分布可能蕴含单通道没有的信息。第一步负责将各模态标准化特征经独立线性投影提取为共享空间的模态令牌并附加可学习融合令牌,得到的令牌序列被传递给注意力模块。第二步用于以单块多头自注意力融合令牌间成对交互并生成融合表示,该融合表示被送入后续宽深汇合环节。第三步负责用并行宽线性分支提取拼接特征的线性决策并与深分支融合后解码输出生物同步指数,输出结果进入下一步的判别与严重度关联评测。与静态早期拼接和投票晚融合相比,关键差异是注意力提供数据依赖的按记录加权,同时宽分支在假设类层面包含拼接线性决策,避免小模型为拟合线性边界浪费容量。在论文报告的评测设置下,本文方法相较拼接基线的AUC指标从0.926升至0.928,方向为更高。适用边界是:结论仅刻画两组合成队列仿真下的计算行为,不支持临床推断,外推需在真实AI-READI记录与前瞻性可穿戴队列上重估判别、校准与缺失模式。成本方面,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。