论文解读

线性看起来一样,失真后为何分叉:Moog 梯子滤波器非线性行为的同基准量化

以同一 SPICE 梯子电路为基准,用谐波、自振荡与大信号截止点偏移三类可复述测量,比较五种数字实现并在公共核心上做饱和器与位置消融,最强证据是分布式 1+4 级实现聚在频谱误差 0.04% 至 0.10% 而边界饱和的 JUCE 达 0.65%,代价是只覆盖静态与准静态条件且未做听感与硬件验证。

 · 更新于 2026-09-24 · 约 22 分钟 · 10677 字 阅读 →
论文解读

孤立很快不等于混音中不爆音:苹果芯片上神经音频推理的竞争实测

该研究在苹果 M3 上对比 BNNSGraph 等推理后端处理 LSTM、TCN、WaveNet 吉他音色模型的速度,核心证据是孤立实时系数很好但在真实混音回调下尾延迟爆表,而代价是平台绑定与状态实现差异需要逐项核对。

 · 更新于 2026-09-24 · 约 21 分钟 · 10348 字 阅读 →
论文解读

单图加文本加音频做分钟级视频:Soul 用关键帧锚定与阈值码本抑制长时漂移

Soul 针对单帧人物图加文本加音频的人体动画任务,在 Wan2.2-5B 上新增音频注意力并用关键帧表示、段间重叠与阈值码本维持长时一致,再用步数蒸馏与轻量 VAE 加速,在 Soul-Bench 的开源对比与商用人评中取得优势,代价是复杂全身大动作仍可能出现伪影。

 · 更新于 2026-09-24 · 约 22 分钟 · 10657 字 阅读 →
论文解读

语音一说就信?SVHalluc 检验语音与画面是否真的对上

论文针对语音内容与视频画面的语义和时间对齐问题,构造 2405 个问答的 SVHalluc 基准并测试多款音视频大模型,最强证据是 Gemini-2.5-Pro 在全局语义对齐上达到 93.10% 而多数开源模型徘徊在 50% 附近,代价是开源模型跨模态绑定能力仍接近随机且需额外的人工核验构造流程。

 · 更新于 2026-09-24 · 约 19 分钟 · 9059 字 阅读 →
论文解读

从固定图文对到任意交错组合:UniM 为何要同测语义结构与连贯

UniM 面向任意组合交错输入输出的理解与生成任务,用 31026 个多任务实例与语义质量、结构完整、交错连贯三维评估检验模型,报告显示现有任意到任意模型得分偏低,而带可追溯推理的智能体基线 UNIMA 更高但仍不完备。

 · 更新于 2026-09-24 · 约 19 分钟 · 9438 字 阅读 →
论文解读

同步声画为何难评:VABench 用三任务十五维卡住语义与对齐

针对带同步音频的视频生成缺乏联合评测的问题,VABench 用文本到声画、图像到声画与立体声三类任务和专家加多模态大模型的十五维评估组织测试,报告显示端到端音视频模型在对齐与细粒度问答上占优而语义同步真实感难以兼得,且立体声空间分离均不可靠。

 · 更新于 2026-09-24 · 约 19 分钟 · 9429 字 阅读 →
论文解读

不只把话说对,还要动得对:ViBES 如何联合规划语言与身体

ViBES 针对多轮对话中语言与身体脱节的问题,采用文本语音专家加面部与身体专家的混合模态专家结构并在 25 帧统一时钟上联合生成,在对话行为基准上取得高于共语音手势与文本到动作基线的对齐度,代价是依赖单目重建数据与尚不完善的行为评价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9907 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把台词说得像那个人:ActorMind 用看听想说四步做语音角色扮演

针对文本角色扮演忽略语音自发性和人物声音一致性的问题,ActorMind 用眼耳脑口四智能体的现成推理流程组织语音合成,在 Friends 第一季构建的 7653 句基准上以 RP-MOS 取得平均 3.56 分的报告结果,但其评估依赖小规模主观打分且未训练模型参数。

 · 更新于 2026-09-24 · 约 20 分钟 · 9662 字 阅读 →
论文解读

相同文字不同处境,相同处境不同语气:AEQ-Bench 拆解全模态模型共情

AEQ-Bench 用 1,885 个音频加文本实例把共情拆成生成回应与判断回应 2 类任务,用相同话语换语境和相同语境换语调 2 种对照进行测试,报告显示带音频输出的模型在自然度与语音表达上占优,而细粒度韵律自动评估仍不可靠,代价是依赖人工核验与粗粒度量表。

 · 更新于 2026-09-24 · 约 18 分钟 · 8948 字 阅读 →
论文解读

母语和语音一换就失灵:Afri-MCQA 拆解非洲文化问答的语言与模态瓶颈

论文用 15 种非洲语言、约 7.5k 对图文加母语录音的平行问答测文化理解,最强闭源模型文本选择题仅 78% 而开放问答仅 38%,开源模型在母语语音开放问答上近零分且语音识别与语种识别先失灵。

 · 更新于 2026-09-24 · 约 18 分钟 · 8682 字 阅读 →
论文解读

听不清就靠编:用反事实硬负例把音频时间线对齐回声学证据

针对大音频语言模型在事件遗漏、身份误判、时序关系与定量时间四类细粒度推理上依赖语言先验的问题,论文以共享音频问题池同时构造偏好对齐数据与诊断基准并用直接偏好优化对齐 Qwen2.5-Omni-7B,报告在诊断集上定量与关系错误率大幅下降并在公开基准上小幅提升,代价是依赖字幕代理、人工筛选与自动裁判误差等条件约束。

 · 更新于 2026-09-24 · 约 18 分钟 · 8911 字 阅读 →
论文解读

标签之外:用方言度与录音条件重新刻画阿拉伯方言语音

针对方言阿拉伯语数据分散与标注不一致问题,Arab Voices 用统一转写与元数据对齐 31 个数据集并以方言度与音频质量代理做可比刻画,在 14 个方言零样本评测中显示现代模型仍困难而多模态大模型相对更稳,代价是音频质量代理与人感并不完全一致且部分低资源方言仍缺乏数据。

 · 更新于 2026-09-24 · 约 18 分钟 · 8790 字 阅读 →
论文解读

交替听与读才能检准:ATIR 把音频文本交织序列当作一等检索对象

针对音频与文本交替出现的多轮上下文检索,论文构造统一 ATIR 基准并训练带音频令牌选择器的双编码器 ATIR-Qwen-3B,报告平均 78.86% Recall@1 和 85.09% nDCG@5,最强对照下仍保留打乱交织结构即下降的反证,代价是两阶段微调与选择器阈值调节。

 · 更新于 2026-09-24 · 约 22 分钟 · 10817 字 阅读 →
论文解读

声音没变意思却绕过拒绝:AJailBench 用语义守恒的信号扰动测大音频语言模型

针对大音频语言模型越狱评测只做文本转语音的问题,该工作先建 1495 条 10 类音频基线集,再用语义一致约束加贝叶斯优化组合时域频域混合扰动生成更强攻击,并在 7 个模型上报告攻击成功率等五项指标显示微小保义扰动仍显著降低安全性,同时以严格拒绝换可用性为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9915 字 阅读 →
论文解读

真人说话会改口、会铺垫、会有背景音:多轮语音对话为何最难记住和改对

该研究把多轮语音交互拆成记忆、指令、一致性和语音改口四个轴,用 452 段无脚本真人录音和 1712 条原子细则做固定上下文评测,报告最高模型仅 54.65% 通过率且语音改口最难,同时付出长音频一致性下降与声音线索记忆明显弱于语义记忆的代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8917 字 阅读 →
论文解读

从认出任务到学出规则:AudioICL-Bench 把音频上下文学习拆成感知与操作两轴

该文用每幕重采样的九任务诊断音频任务学习,显示最强模型在非语音模式绑定上可学、但在时长测量与多规则组合上崩溃,而代价是人工构造任务与小样本精确匹配评估的生态距离。

 · 更新于 2026-09-24 · 约 16 分钟 · 7672 字 阅读 →
论文解读

听声辨物还不够:AUDITA 用人类 trivia 逼出音频问答的推理缺口

针对音频问答依赖短线索和文本捷径的问题,AUDITA 用 9690 个人类撰写的真实音频 trivia 题加项目反应理论分析,显示人类自由作答 32.13% 而模型平均仅 8.86%,代价是题源偏英语 trivia 且人类基线为非专家抽样而非能力上限。

 · 更新于 2026-09-24 · 约 20 分钟 · 9868 字 阅读 →
论文解读

希腊语歌声转写:规模放大适配效果,小模型靠翻译正则,大模型靠两阶段专注

该研究把希腊音频数据集扩展为片段对齐的歌词转写基准,在同一协议下对比 Whisper 三种规模与转写翻译配比及先语音后歌声的两阶段适配,报告 Large-v3 两阶段词错误率 27.2%,代价是翻译辅助只在小容量模型上为正且增强与复调训练均未获益。

 · 更新于 2026-09-24 · 约 17 分钟 · 8062 字 阅读 →