论文解读

把应变写进光路:振膜集成波导干涉传声器的上限分析

该文研究用振膜集成光波导马赫-曾德尔干涉仪把声压转成光程差再转成光电流的传声器,以解析模型评估信噪比、声过载与动态范围上限,结论是在常规微机电与测量传声器应用中无总体优势,可能价值在高温等恶劣环境。

 · 更新于 2026-09-24 · 约 17 分钟 · 8416 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

稀疏也稳、稠密也准:用距离加权的 KNN 与 MLP 校准机器人乐器

针对机械漂移导致的机器人乐器动态响应不一致问题,论文用距离依赖加权把锚定实测的 KNN 与平滑泛化的 MLP 融合成一体,在 MalletOTon 四种采样密度下以平均 MAE 约 1.38 取得最低误差,代价是仍只用 RMS 单特征且未验证在线闭环与多乐器复现。

 · 更新于 2026-09-24 · 约 22 分钟 · 10573 字 阅读 →
论文解读

同一份自然声景为何实验室听得准、博物馆听得散:房间与阵列如何重塑沉浸

该研究用 2 阶录制加 3 阶解码把 5 段自然声景放在实验室与博物馆的 16 只 Genelec 阵列上对比,报告显示存在感较稳而深度、包围感、清晰度与稳定性在混响展厅中下降,代价是房间与垂直阵列构形混在一起无法分离。

 · 更新于 2026-09-24 · 约 16 分钟 · 7868 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只反转波形不删除人声:分段逆放如何同时保住场景与音质

针对环境录音中可懂语音的隐私问题,论文用语音活动检测加语音分离定位语音后再做分段波形反转,在 CitySpeechMix 上报告词错误率 97.9%、声源分类准确率下降 2.7%、FAD 为 1.40,代价是确定性反转可被二次处理部分恢复,需重排序增强鲁棒性并损失音质。

 · 更新于 2026-09-24 · 约 19 分钟 · 9089 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

不写新评测脚本:用统一比较器把文本、计划、时序与多媒体放在同一流程里

针对生成式输出分散在文本、规划序列、时序与图像音频且缺乏可复现比较流程的问题,GAICo 选择事后基于参考的统一比较框架与可扩展指标库,在三管线旅行助手案例中分离编排与执行故障,但仍不覆盖公平性与延迟等维度。

 · 更新于 2026-09-24 · 约 16 分钟 · 7724 字 阅读 →
论文解读

信噪比为何失准:从相位距离重写音频生成的度量与损失

论文把信噪比失准归因于瞬时相位距离不可靠,用全向相位导数重写相关项得到 GOMPSNR,并在声码器与编解码器上验证其与听感指标更相关且导出损失能提升重建质量,但线性幅度等组合在小数据上存在过拟合代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9170 字 阅读 →
论文解读

同样 2 倍速为何体验不同:按运动、语速和节奏算快放感知质量

该文在 1x 到 3x 主观评分基础上,用视频时间信息、语音语速和音乐节拍分别拟合指数衰减并融合成视听模型,在独立新序列上与主观均值高度一致,但意图推断只做到粗粒度辅助。

 · 更新于 2026-09-24 · 约 15 分钟 · 7185 字 阅读 →
论文解读

当语音 Token 不再像自然语言:13 个编解码器在噪声下的语言统计学分化

语音编码 | 6.3/10

 · 更新于 2026-09-24 · 约 31 分钟 · 15156 字 阅读 →
论文解读

方差不该越过底线:用单峰约束重画 MOS 的容许区间

语音质量评估 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7106 字 阅读 →
论文解读

当目标永远无法被完美复刻,我们该如何评判模仿的好坏?

音频生成 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5751 字 阅读 →
论文解读

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

音频质量评估 | 7.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6318 字 阅读 →
论文解读

Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings

语音识别 | 8.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4624 字 阅读 →
论文解读

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

音频质量评估 | 8.9/10

 · 更新于 2026-09-24 · 约 12 分钟 · 6001 字 阅读 →
论文解读

Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5015 字 阅读 →
论文解读

Tracking the Trend in How Speech Synthesizers Deceive People

语音伪造检测 | 6.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4931 字 阅读 →
论文解读

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

音频质量评估 | 6.5/10

 · 更新于 2026-09-24 · 约 6 分钟 · 3001 字 阅读 →
论文解读

InvFlowFD: Reference-Free and Background-Set-Free Perceptual Music Quality Metric with Flow Matching Inversion

音频质量评估 | 6.4/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5422 字 阅读 →