论文解读

长期照护肺炎听诊:X 线监督与三通道前胸协议的稳定判别

针对日本长期照护高龄有症状人群的六通道前胸数字听诊任务,论文用 X 线监督训练共享权重 ARP-N 卷积网络并在病人级重复交叉验证下比较临床诊断监督,最强证据是听诊单模态 XRAY 模型 F1 为.729、准确率为.783 而融合模型 AUC 为.791,代价是单中心 185 例与域漂移限制外推。

 · 约 19 分钟 · 9465 字 阅读 →
论文解读

先分对白再分音乐音效:LiteCASS 用两级子带 U-Net 做立体声实时分离

针对立体声电影音频要同时分出对白、音乐、音效并保住空间感的问题,LiteCASS 用确定性子带重排加两级紧凑 U-Net 做掩码分离,在 DnR v3 立体声扩展上以 1.06 M 参数和 0.72 G 每秒运算量取得平均 SI-SDR 最高,代价是语音感知指标仍落后于更大基线与视觉辅助系统。

 · 更新于 2026-09-24 · 约 19 分钟 · 9469 字 阅读 →
论文解读

耳朵只认内容、方向另学一路:Bearings 把声场与声学拆开预训练

针对单通道自监督音频编码器空间盲的问题,Bearings 用掩码重建方向场与双尺度扩散度学习可复用的声场嵌入,冻结拼接后在两个 SELD 数据集上把位置相关 F 值从 4 以下提升到 40 以上,代价是仍需轻量融合头训练且部分指标未超越联合训练模型。

 · 更新于 2026-09-24 · 约 19 分钟 · 9168 字 阅读 →
论文解读

把旋转和镜像写进网络:EquiSELD 如何用标量加向量做等变声事件定位与检测

针对一阶 Ambisonics 在旋转与镜像下方向变化而声源不变的问题,EquiSELD 用不变标量与等变强度向量双流加等变注意力实现严格 O(3) 等变,在 TAU2021 上以 0.40 的综合分超过基线并以约 19 倍更少训练耗时超过已有等变网络,但在 STARSS23 真实场景上优势收窄且仍受类别覆盖与仰角先验限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9164 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

二十毫秒内先分区再跨波束提纯:多级多输入多输出目标语音提取如何兼顾延迟与感知质量

针对强混响重叠与残留回声下的实时目标语音提取问题,该工作用分区多输出前端加在线波束形成再加跨波束细化的三段流水线,在十九点八七五毫秒延迟约束下把开发集可懂度和感知质量从基线附近明显抬高,而第二阶段更干净的主观听感反而在受污染近讲参考下出现客观分下降。

 · 更新于 2026-09-24 · 约 23 分钟 · 11425 字 阅读 →
论文解读

多通道子带切分与说话人调制的实时目标语音提取:MBSRNN 如何把空间线索装进 20 毫秒

针对助听设备的多通道目标说话人提取问题,MBSRNN 用 33 子带切分分别处理混合语音与注册语音并以 FiLM 交错 LSTM 注入说话人信息,在 CHiME-9 开发集流式条件下把 fwSNRseg 从基线约 2.2 提升到约 4.4 至 4.6,代价是约 53.1M 参数与处理一秒片段约 224.3 GMACs 运算量以及 STOI 未稳定提升。

 · 更新于 2026-09-24 · 约 18 分钟 · 8792 字 阅读 →
论文解读

同一套因果 Mamba 核心如何兼顾 16 毫秒流式与高延迟离线增强

该文针对 CHiME-9 Task2 多通道助听增强的延迟与跨通道建模矛盾,采用延迟感知外壳加单向时间 Mamba 核心的解耦结构,在助听器开发集上因果配置以 1.36M 参数和 0.005 实时率超越官方基线,离线加深配置进一步提升指标但延迟增至秒级。

 · 更新于 2026-09-24 · 约 18 分钟 · 8549 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

不戴耳机看 VR 音乐会:MetaConcert 如何把头显画面与穹顶声场锁在一起

针对头显加耳机造成使用者与同室他人隔绝的问题,MetaConcert 选择 WebXR 播放 360°视频加 SuperCollider 播放预解码三阶 Ambisonics 穹顶声场的分流架构并用 OSC 桥接同步,在约 10 分钟节目上经感知验证同步可用,代价是仍依赖中央听音点、局域网质量与人工校准。

 · 更新于 2026-09-24 · 约 18 分钟 · 8979 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

不估相位、只控增益:有界掩蔽与交叉注意力如何在 20 毫秒内做目标说话人提取

该文在因果多通道 TF-GridNet 基线上把复谱回归改为有界幅度掩蔽加混合相位复用并配多分辨率谱损失,方法 2 再把全局 FiLM 换成 16 个说话人令牌的交叉注意力 FiLM,在 CHiME-9 开发集上以频率加权信噪比下降为代价换取 Csig 感知质量提升且保持 20 毫秒算法延迟。

 · 更新于 2026-09-24 · 约 16 分钟 · 7751 字 阅读 →
论文解读

不动主模型只调混合旋钮:用感知奖励微调多通道语音增强

该文在因果多通道时频网格网络基线不动的情况下,用近端策略优化学习少量混合系数,以感知函数相对基线的提升为奖励,在助听器四通道与眼镜七通道发育集上取得小幅稳定改进,但混合结构保守且奖励依赖预训练评估模型。

 · 更新于 2026-09-24 · 约 18 分钟 · 8625 字 阅读 →
论文解读

二十只音箱包住一个甜点:在教室里装下三阶全球声场

该报告为教学与研究搭建 20 只同轴音箱的正十二面体三阶全球 Ambisonics 系统,把 16 通道 HOA 解码到 20 路输出,用机械对准加插件补偿与声压归一完成校准,四年使用报告显示定位与包围感可用但单体保真度有限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8382 字 阅读 →
论文解读

年轮作穹顶:把生态录音与语言痕迹做成同心的时间尺度

该作品以树木年轮为结构隐喻,用颗粒与频谱处理、VBAP 穹顶空间化与文本到三维扩散生成,把约八分半钟的微观到宏观生态时间做成穹顶声像层,其代价是垂直声像不如水平声像清晰且缺乏可量化的听众评估。

 · 更新于 2026-09-24 · 约 21 分钟 · 10513 字 阅读 →
论文解读

主噪声关不掉时,如何把扬声器漏进参考麦的声音减掉

针对多通道前馈主动噪声控制中次级扬声器到参考麦的声反馈在主噪声持续存在时难以标定的问题,论文提出用参考组到反馈组的相对传递矩阵加协方差相减来估计并扣除反馈分量,仿真报告显示其降噪接近理想无主噪声标定上界而直接估计与无补偿基线失稳或仅约负 2 分贝,代价是需要两次受控测量与额外反馈麦组。

 · 更新于 2026-09-24 · 约 18 分钟 · 8980 字 阅读 →
论文解读

从参数画形到按顶点走形:等弧长引擎如何统一任意多边形、形变与多面体截面

该文把多边形合成改写为等弧长遍历外部顶点缓冲的二维振荡器,用混合插值实现不等顶点数形变、用旋转多面体水平截面扩展到三维,并以四点 polyBLAMP 加自适应过采样压制混叠,最强证据是 M=5 四形状共享谐波格而格外成分低于分析底噪,代价是几何缓存、成对齐与交叉淡化的额外管理。

 · 更新于 2026-09-24 · 约 23 分钟 · 11451 字 阅读 →
论文解读

亲密与广袤之间:用骨传导耳机与穹顶扬声器写分层现场

该研究以骨传导耳机私密层加穹顶扬声器共享层加现场声源的三层现场为问题,用四部新作与作曲家自述对照出频带分工与层间关系策略,最强证据是录音仓储已公开可核对,代价是电平与注意力极易饱和且结论仍是作曲家报告而非大样本验证。

 · 更新于 2026-09-24 · 约 23 分钟 · 11254 字 阅读 →
论文解读

用听者自己的双耳线索抓目标说话人:个性化头相关传输函数做双耳提取

该文以目标方向对应的个性化头相关传输函数为线索,用全复数神经网络从双耳混合中提取目标并保留双耳线索,在无混响下取得清晰提取、在混响下兼顾去混响,但混响下的客观语音质量仍低于同期强基线。

 · 更新于 2026-09-24 · 约 19 分钟 · 9312 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →