线性看起来一样,失真后为何分叉:Moog 梯子滤波器非线性行为的同基准量化
以同一 SPICE 梯子电路为基准,用谐波、自振荡与大信号截止点偏移三类可复述测量,比较五种数字实现并在公共核心上做饱和器与位置消融,最强证据是分布式 1+4 级实现聚在频谱误差 0.04% 至 0.10% 而边界饱和的 JUCE 达 0.65%,代价是只覆盖静态与准静态条件且未做听感与硬件验证。
以同一 SPICE 梯子电路为基准,用谐波、自振荡与大信号截止点偏移三类可复述测量,比较五种数字实现并在公共核心上做饱和器与位置消融,最强证据是分布式 1+4 级实现聚在频谱误差 0.04% 至 0.10% 而边界饱和的 JUCE 达 0.65%,代价是只覆盖静态与准静态条件且未做听感与硬件验证。
该研究在苹果 M3 上对比 BNNSGraph 等推理后端处理 LSTM、TCN、WaveNet 吉他音色模型的速度,核心证据是孤立实时系数很好但在真实混音回调下尾延迟爆表,而代价是平台绑定与状态实现差异需要逐项核对。
Soul 针对单帧人物图加文本加音频的人体动画任务,在 Wan2.2-5B 上新增音频注意力并用关键帧表示、段间重叠与阈值码本维持长时一致,再用步数蒸馏与轻量 VAE 加速,在 Soul-Bench 的开源对比与商用人评中取得优势,代价是复杂全身大动作仍可能出现伪影。
论文针对语音内容与视频画面的语义和时间对齐问题,构造 2405 个问答的 SVHalluc 基准并测试多款音视频大模型,最强证据是 Gemini-2.5-Pro 在全局语义对齐上达到 93.10% 而多数开源模型徘徊在 50% 附近,代价是开源模型跨模态绑定能力仍接近随机且需额外的人工核验构造流程。
UniM 面向任意组合交错输入输出的理解与生成任务,用 31026 个多任务实例与语义质量、结构完整、交错连贯三维评估检验模型,报告显示现有任意到任意模型得分偏低,而带可追溯推理的智能体基线 UNIMA 更高但仍不完备。
针对带同步音频的视频生成缺乏联合评测的问题,VABench 用文本到声画、图像到声画与立体声三类任务和专家加多模态大模型的十五维评估组织测试,报告显示端到端音视频模型在对齐与细粒度问答上占优而语义同步真实感难以兼得,且立体声空间分离均不可靠。
ViBES 针对多轮对话中语言与身体脱节的问题,采用文本语音专家加面部与身体专家的混合模态专家结构并在 25 帧统一时钟上联合生成,在对话行为基准上取得高于共语音手势与文本到动作基线的对齐度,代价是依赖单目重建数据与尚不完善的行为评价。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对文本角色扮演忽略语音自发性和人物声音一致性的问题,ActorMind 用眼耳脑口四智能体的现成推理流程组织语音合成,在 Friends 第一季构建的 7653 句基准上以 RP-MOS 取得平均 3.56 分的报告结果,但其评估依赖小规模主观打分且未训练模型参数。
AEQ-Bench 用 1,885 个音频加文本实例把共情拆成生成回应与判断回应 2 类任务,用相同话语换语境和相同语境换语调 2 种对照进行测试,报告显示带音频输出的模型在自然度与语音表达上占优,而细粒度韵律自动评估仍不可靠,代价是依赖人工核验与粗粒度量表。
论文用 15 种非洲语言、约 7.5k 对图文加母语录音的平行问答测文化理解,最强闭源模型文本选择题仅 78% 而开放问答仅 38%,开源模型在母语语音开放问答上近零分且语音识别与语种识别先失灵。
针对大音频语言模型在事件遗漏、身份误判、时序关系与定量时间四类细粒度推理上依赖语言先验的问题,论文以共享音频问题池同时构造偏好对齐数据与诊断基准并用直接偏好优化对齐 Qwen2.5-Omni-7B,报告在诊断集上定量与关系错误率大幅下降并在公开基准上小幅提升,代价是依赖字幕代理、人工筛选与自动裁判误差等条件约束。
针对方言阿拉伯语数据分散与标注不一致问题,Arab Voices 用统一转写与元数据对齐 31 个数据集并以方言度与音频质量代理做可比刻画,在 14 个方言零样本评测中显示现代模型仍困难而多模态大模型相对更稳,代价是音频质量代理与人感并不完全一致且部分低资源方言仍缺乏数据。
针对音频与文本交替出现的多轮上下文检索,论文构造统一 ATIR 基准并训练带音频令牌选择器的双编码器 ATIR-Qwen-3B,报告平均 78.86% Recall@1 和 85.09% nDCG@5,最强对照下仍保留打乱交织结构即下降的反证,代价是两阶段微调与选择器阈值调节。
针对大音频语言模型越狱评测只做文本转语音的问题,该工作先建 1495 条 10 类音频基线集,再用语义一致约束加贝叶斯优化组合时域频域混合扰动生成更强攻击,并在 7 个模型上报告攻击成功率等五项指标显示微小保义扰动仍显著降低安全性,同时以严格拒绝换可用性为代价。
该研究把多轮语音交互拆成记忆、指令、一致性和语音改口四个轴,用 452 段无脚本真人录音和 1712 条原子细则做固定上下文评测,报告最高模型仅 54.65% 通过率且语音改口最难,同时付出长音频一致性下降与声音线索记忆明显弱于语义记忆的代价。
该文用每幕重采样的九任务诊断音频任务学习,显示最强模型在非语音模式绑定上可学、但在时长测量与多规则组合上崩溃,而代价是人工构造任务与小样本精确匹配评估的生态距离。
针对音频问答依赖短线索和文本捷径的问题,AUDITA 用 9690 个人类撰写的真实音频 trivia 题加项目反应理论分析,显示人类自由作答 32.13% 而模型平均仅 8.86%,代价是题源偏英语 trivia 且人类基线为非专家抽样而非能力上限。
该研究把希腊音频数据集扩展为片段对齐的歌词转写基准,在同一协议下对比 Whisper 三种规模与转写翻译配比及先语音后歌声的两阶段适配,报告 Large-v3 两阶段词错误率 27.2%,代价是翻译辅助只在小容量模型上为正且增强与复调训练均未获益。