aaai-2026 论文深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对首尔韩语重音短语连续基频难以对应离散声调类别的问题,论文用双分支有监督对比学习整条轮廓的整体形状,在 10093 个短语上达到准确率 77.75% 与宏 F1 值 51.54%,代价是稀有类别与长低平尾音仍易混淆。
针对纯文本盈利预测依赖商业数据的问题,该研究构造 2688 场带逐词转录、全程音频和幻灯片的多模态基准并评测 26 个模型,最强证据是高准确率多为类别不平衡造成的假象而多模态增益有限,代价是长文本截断、采样幻灯片与类别严重偏斜。
针对片段级描述数据量大但无时间信息与帧级短语标注稀少难同训的问题,FineLAP 用全局与细粒度解耦音频适配器加片段与帧双流 Sigmoid 损失同训,在 AudioCaps 检索 R@1 取得 45.7 与 62.5 并在四组声音事件检测上领先,代价是固定 10 秒输入与合成数据分布偏差仍待验证。
针对音频语言模型提示调优在基类上过拟合、新类上掉点的问题,论文提出用大模型生成语义邻居并以带间隔的拉近推远损失约束文本空间,在 11 个数据集平均上把 CoOp 新类准确率从 34.09% 提升到 42.98%,代价是训练时每个类要多编码 10 个邻居文本。
该文在 FSD50K 与 AudioSet 上以 30 类起步加 4 个 5 类增量任务比较冻结、蒸馏与核级可塑性调制,报告显示冻住卷积特征并只微调动态分类头遗忘最小而核级约束反而更不稳定,但新类学习能力仍低于联合训练。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对自然声景高噪声鸟鸣分类问题,论文用 Epanechnikov 先验贝叶斯小波收缩显式规则去噪,再以倒谱加谱指数特征训练监督分类器,最强证据是 10 维特征下支持向量机与多项逻辑回归准确率达 0.94 量级,代价是高维增益递减且部分高阶特征无贡献。
论文把短时傅里叶、Mel、倒谱和 Gammatone 直接搬到全同态加密上,用膨胀、贫民变换等近似降低累加器位宽,在 VocalSet 和 OxVoc 上把描述符统计错误率从常规方法的 5.9% 和 6.5% 降到膨胀 4 倍时的 4.7% 和 1.9%,代价是 64 毫秒音频加密计算约 12970 秒且高频谐波丢失。
针对转写文本丢失语气与环境线索且难以拆解分层话术的问题,SAFE-QAQ 用端到端音频大模型加三阶段规则奖励强化学习做慢思考推理,在 TeleAntiFraud-Bench 上以 SAFE-LS 取得场景 84.64、欺诈 89.61、类型 88.23 的加权 F1,代价是仍依赖单一数据集且实时版类型精度有所下降。
把文本解码器的 DiscoGP 搬到 HuBERT 与 Wav2Vec 2.0 上做分类电路发现,用冻结与随机对照验证预训练计算的作用,并以砍掉 QKV 残差把边发现显存从四次降到三次,代价是部分任务仍需保留 MLP 残差与早停。
针对级联转写在低资源语言和口音下丢失声学线索且误差传播的问题,论文用冻结 MiMo-Audio-7B 加任务加共享加语言残差三段软提示做端到端二分类,在 PolySpeechTox 上报告微平均 ROC-AUC 为 98.07%,代价是只验证了单一骨干且依赖语言口音标签做训练路由。
针对纯文本审核漏掉语气、情绪与语速等副语言毒性的问题,该研究构建带毒性来源标注的 ToxiAlert-Bench 并采用双头加多阶段训练的 ToxiAlert 模型,最强证据是在自建基准上相对最强基线 Macro-F1 相对提升 21.1%、准确率相对提升 13.0%,代价是合成数据依赖 TTS 表现力与细粒度类别仍存在明显短板。
论文用线性残差化减去音素与二三音子成分后,发现英文预训练的 HuBERT 和 wav2vec 2.0 靠后层仍能在帧级别线性预测词身份,并在词发现中验证去音素表示的改善,代价是依赖对齐标签且音素去除未降到机会水平。
针对同音替换、字形拆解、缩写与中英混写等伪装使纯文本失效的问题,MMBERT 把文本、合成语音与字形图像经对齐器送入共享自注意力加混合专家结构,并用三阶段渐进训练稳定优化,在 ToxiCloakCN 上报告 F1 为 95.2,代价是依赖合成多模态输入与较重的分阶段调参。
针对听诊数据稀缺且正常与异常声音频谱特性不同,PASA 把增强选择建模为马尔可夫决策过程并用混合批量-样本策略执行,在三个基准上提升诊断分数,但个性化依赖验证集奖励与样本统计积累,计算代价高于固定增强。
针对无编程背景学生与生物声学研究者难以串起特征、降维、聚类与分类的问题,AI EcoSound Tutor 用 MFCC/OpenL3 加 PCA/t-SNE/UMAP 加 K-Means/GMM/HDBSCAN 的可配置流水线组织学习,最强证据是在蝗虫录音上 MFCC-UMAP 组合达到轮廓系数 0.9 并经频谱图与回放验证,代价是方法子集有限且仅支持 …
该研究以六类蚊种图像加 5 秒翅振音频为输入,用 SwinV2 与音频频谱变换器分别输出类别对数再做可学习加权融合,在干净集上融合准确率为 97.8 未超过单模态,而在图像与音频双侧加噪后融合仅下降 4.66 个百分点的代价是需要配对双模态输入与联合微调。
该文在两个闭集溯源任务上冻结支撑区做前瞻性单阶段编解码压力测量,显示干净 Macro-F1 超 0.97 的表示仍可单点损失超 50 点且损失随条件与表示剧烈变化,而预注册的匹配保真度比较因无共同支撑不可估计。