Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases

📄 一个人、一套配方、七种适配器:重度构音障碍识别该押注哪种微调 英文题目:Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases 一句话:在同一位匈牙利语重度构音障碍说话人和固定小数据配方下比较七种低秩适配器与两种语音基座,发现只有标准低秩家族真正有效且内部打成平手,于是选择更简单省时的标准低秩作为每患者部署默认,并用注册时长与适配位置阶梯标定临床代价。 标签:#语音识别 | #参数高效微调 | #低资源 | #医疗音频 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5 👥 作者与机构 Bernard Muller:The Scott-Morgan Foundation, Torquay, United Kingdom László Tóth:Institute of Informatics, University of Szeged, Szeged, Hungary LaVonne Roberts:The Scott-Morgan Foundation, Torquay, United Kingdom 💬 毒舌点评 把每患者独立适配器这一生产设定做成控制变量的诚实对照值得肯定,还敢把NeMo崩溃和匈牙利语热启动回退写成命名小节。但证据厚度只有单说话人单语言单病因,核心选型结论建立在复用评测集和单样本区间上,跨变体推广更像临床备忘而非可泛化结论。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 906 words

Predictors of Loneliness in Older Adults Using Multimodal Analysis of Speech and Language

📄 孤独听得出来吗:当说什么比怎么说更诚实 英文题目:Predictors of Loneliness in Older Adults Using Multimodal Analysis of Speech and Language 一句话:这项研究用 310 位老人的 1465 次电话随访检验了语言内容与声音特征对孤独感的关联,发现文本更稳、声音在特定人群更灵,而两者合在一起也只能解释很小一部分差异。 标签:#语音情感识别 | #多模态模型 | #模型集成 | #医疗音频 评分:4.9/10 | 创新 0.7/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5 👥 作者与机构 Vinmay Khandode:机构信息未在 arXiv HTML 中可靠披露 Sai Karthik Kosuri:机构信息未在 arXiv HTML 中可靠披露 Neil K. R. Sehgal:机构信息未在 arXiv HTML 中可靠披露 Adam Greene:机构信息未在 arXiv HTML 中可靠披露 Elif Alpoge:机构信息未在 arXiv HTML 中可靠披露 Elana Duffy:机构信息未在 arXiv HTML 中可靠披露 Matthew Lee Smith:机构信息未在 arXiv HTML 中可靠披露 Thomas K.M. Cudjoe:机构信息未在 arXiv HTML 中可靠披露 Sharath Chandra Guntuku:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把自然电话随访中的说什么和怎么说放在同一回归与参与者层面验证下硬碰硬,并做了性别与种族分层,问题意识诚实克制。硬伤是关联与预测效应整体微弱,重复测量的非独立性与声学侧多重比较处理粗糙,所谓多模态增益只是特征堆叠的边际红利,离可部署筛查还很远。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 718 words

Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living

📄 关掉麦克风不行,擦掉人声才行:助老监听的隐私防火墙 英文题目:Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living 一句话:针对居家助老声音监测不敢录下谈话的落地难题,论文把语音剥离做成传感器后端防火墙,用全合成训练的 U 型谱映射 suppress 可检出语音并尽量保住活动识别,在轻干扰下恢复接近无语音基线,但重语音与真实强干扰下的不可懂性仍未被证明。 标签:#音频分类 | #迁移学习 | #语音活动检测 | #医疗音频 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Pavlos Nicolaou:KIOS Research and Innovation Center of Excellence, University of Cyprus, Panepistimiou 1, Aglantzia, Nicosia, 2109, Cyprus Christos Efstratiou:School of Computing, University of Kent, Canterbury, CT2 7NZ, Kent, United Kingdom 💬 毒舌点评 把语音去除做成助老传感前端防火墙并坚持全合成训练,问题来自真实护理院部署痛点,链路完整值得肯定。但隐私证据几乎只靠语音活动检测(Voice Activity Detection / VAD)清零,且评估分支经过有损梅尔逆变换加Griffin-Lim重合成,所谓0%更多是检测器失明而非语音不可懂,强语音与多说话人家庭仍是外推。 ...

2026-09-03 · 更新于 2026-09-04 · 6 min · 1227 words

语音/音乐/音频论文速递 2026-09-03

语音/音乐/音频论文速递 2026-09-03 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 6 篇 ██████ #语音合成 2 篇 ██ #音频分类 2 篇 ██ #声源定位 1 篇 █ #语音增强 1 篇 █ #语音情感识别 1 篇 █ #音乐生成 1 篇 █ #音视频理解 1 篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AVERT: Audio-Verified Adjudication for Spoken Dialogue… 7.6 前25% 方法研究 #语音识别 🥈 Hearing the Whispers: Black-Box Membership Inference… 7.5 前25% 方法研究 #语音合成 🥉 The Missing Temporal Link: Temporal Context Routing… 7.5 前25% 方法研究 #音视频生成 4. VibeVoice-ASR-Streaming Technical Report 7.5 前25% 系统技术报告 #语音识别 5. A Common Measure of Communication for Speech Brain… 7.4 前50% 方法研究 #语音识别 6. SonicCaps: Large-Scale Diverse and Fine-Grained… 7.2 前50% 数据集与基准 #音频检索 7. Understanding Automatic Mixing: A Subtask-Oriented… 7.0 前50% 应用研究 #音乐生成 8. Scalable Direction-Following TTS via Voice Impression… 6.8 前50% 方法研究 #语音合成 9. Efficient Passive Acoustic Monitoring of Killer Whales… 6.7 前50% 应用研究 #音频分类 10. Auditory Illusion Benchmark for Large Audio Language… 6.4 前50% 数据集与基准 #音频理解 11. ARFT: A Synchronized Multimodal RF-Acoustic Dataset… 6.4 前50% 数据集与基准 #声源定位 12. Sensing Bone-Conducted Speech with Earbuds 6.3 前50% 应用研究 #语音增强 13. PhoenixNest-Video: Evidence-Grounded Multimodal Agent… 6.3 前50% 方法研究 #音视频理解 14. SpeakPay: Domain-Adaptive LoRA Fine-Tuning of Whisper… 6.1 前50% 应用研究 #语音识别 15. Removing Speech, Keeping Activities: A Privacy… 5.9 前50% 应用研究 #音频分类 16. Choosing a PEFT Variant for Per-Patient Dysarthric ASR… 5.9 前50% 应用研究 #语音识别 17. VAANI Noise Event Dataset: A curated spontaneous… 5.8 前50% 数据集与基准 #语音识别 18. Predictors of Loneliness in Older Adults Using… 4.9 后 50% 应用研究 #语音情感识别 📋 论文列表 🥇 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking ...

2026-09-03 · 更新于 2026-09-04 · 15 min · 3026 words

XVAE-WMT: Explainable Wavelet-Temporal Variational Autoencoder for Blind Source Separation of Heart and Lung Sounds

📄 单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作 英文题目:XVAE-WMT: Explainable Wavelet-Temporal Variational Autoencoder for Blind Source Separation of Heart and Lung Sounds 一句话:针对单通道心肺音频带重叠与非平稳耦合的盲分离难题,XVAE-WMT 以连续小波前端、时序一致性正则与软掩码约束改造变分自编码器,并用 SHAP 筛选潜维度,在人工混合集上取得 26.8 dB SDR 的同时保留可解释的分离路径。 标签:#音频分离 | #变分自编码器 | #医疗音频 | #可解释性 | #无监督学习 评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Yasaman Torabi:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. Shahram Shirani:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. James P. Reilly:Department of Electrical and Computer Engineering, McMaster University, Hamilton, ON L8S 4K1, Canada. 💬 毒舌点评 将连续小波变换(Continuous Wavelet Transform, CWT)、时序一致性(Temporal Consistency, TC)与软掩码塞进变分自编码器(Variational Autoencoder, VAE)并用SHAP(SHapley Additive exPlanations)做事后剪枝,工程拼装完整且在自制混合集上指标亮眼。问题在于双数据集均为人工随机混合、无真实临床混合验证,时序平滑项与掩码的因果归因被过度包装为可解释性,且关键超参数与统计显著性缺失导致可信度打折。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1456 words

语音/音乐/音频论文速递 2026-09-02

语音/音乐/音频论文速递 2026-09-02 共分析 23 篇论文 ⚡ 今日概览 ✅ 筛选入选 23 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频分类 3 篇 ███ #多模态模型 2 篇 ██ #语音合成 2 篇 ██ #语音增强 2 篇 ██ #语音情感识别 2 篇 ██ #音频分离 2 篇 ██ #语音交互 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(23 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 BiMTokenizer: Preserving Semantic-Acoustic Balance in… 8.3 前25% 方法研究 #语音编码 🥈 A Composable Evaluation System for Reproducible Omni… 8.3 前25% 系统技术报告 #多模态模型 🥉 Phrase-Localized Language-Contrastive Guidance… 8.2 前25% 方法研究 #语音合成 4. Zero-Shot Respiratory Sound Classification through LLM… 7.8 前25% 方法研究 #音频分类 5. A Unified Uncertainty-Aware Back-End for Speaker… 7.8 前25% 方法研究 #说话人验证 6. ABSE-NET: A Lightweight Neural Model for Active… 7.5 前25% 方法研究 #语音增强 7. TUTTI: Toward generalizable audio-to-score… 7.4 前50% 方法研究 #音乐转录 8. Perceptible or Not? Diagnosing Passive Fingerprints… 7.4 前50% 方法研究 #语音伪造检测 9. Ready to Speak: Aligning LLMs for TTS-Friendly Text… 7.4 前50% 方法研究 #语音合成 10. On the Human and Computer Alignment of Attribute-Based… 7.3 前50% 数据集与基准 #音乐检索 11. TimeSteer: Inference-Time Speech Scheduling in Joint… 7.2 前50% 方法研究 #音视频生成 12. VoiceLongMemEval: Do Assistants Remember How You… 7.1 前50% 数据集与基准 #语音情感识别 13. Cleaner Speech, Weaker Generalization: Revisiting Pitt… 7.0 前50% 数据集与基准 #音频分类 14. TAG-Bench: Benchmarking Temporal Audio Grounding in… 6.9 前50% 数据集与基准 #音频理解 15. Artificial Rosetta Stone: Constrained Maximum A… 6.8 前50% 方法研究 #音乐理解 16. XVAE-WMT: Explainable Wavelet-Temporal Variational… 6.6 前50% 方法研究 #音频分离 17. U-PAST: A Phase-Aware Audio Spectrogram Transformer-U… 6.4 前50% 方法研究 #语音增强 18. Conversation Coach: A Voice-enabled AI System that… 6.3 前50% 系统技术报告 #语音交互 19. Soft Posterior Speaker Injection for Multi-Talker… 6.2 前50% 方法研究 #语音识别 20. Heard but Not Heeded: Paralinguistic Information… 6.0 前50% 方法研究 #语音情感识别 21. Ontology-based Target Sound Extraction 5.7 前50% 方法研究 #音频分离 22. MADS: A Multiview Acoustic Descriptor Set Beyond… 5.7 前50% 方法研究 #音频分类 23. TEIDAN: A Multilingual Multiparty Dialogue Corpus 5.1 后 50% 数据集与基准 #多模态模型 📋 论文列表 🥇 单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡 英文题目:BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling ...

2026-09-02 · 更新于 2026-09-04 · 24 min · 4954 words

Context-Aware Interleaved Batching for WhisperX

📄 在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住 英文题目:Context-Aware Interleaved Batching for WhisperX 一句话:面对长音频转写中并行速度与跨段上下文不可兼得的矛盾,论文用 VAD 固定声学边界并以轮询交错批处理恢复 224 词元滚动上下文,在 Earnings-21 上以 8.4 倍于串行 Whisper 的速度将 WER 降至 8.2%、专有名词分数提至 79.3%,代价是首批重转的一次额外前向与小规模评测的不确定性。 标签:#语音识别 #语音大模型 #长音频处理 #高效推理 #医疗音频 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Carlos Bain:机构信息未在 arXiv HTML 中可靠披露 Max Bain:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用语音活动检测(Voice Activity Detection,VAD)外置边界加流间轮询批处理把 Whisper 的 224 词元历史条件从串行枷锁里解放出来,思路巧妙且可直接插进任意分段式流水线。问题在于评测仅靠 15 条 Earnings-21 与 6 条自建 MedicalLessons,基于 GPT-5.1 的 LPS 与 Pn 均无人工一致性校准,8.4 倍加速背后首批重转的额外前向与 N≤B 时退化为近串行的代价也被轻描淡写。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1342 words

Disentangling Representation using Attributes-based Gaussian Estimation for Medical Sound Diagnosis

📄 把咳嗽声拆开:用高斯对齐让模型忘记敏感属性 英文题目:Disentangling Representation using Attributes-based Gaussian Estimation for Medical Sound Diagnosis 一句话:针对咳嗽声诊断中属性域偏移与可解释性不足,论文用属性映射嵌入将标量属性高斯化并与 VAE 隐向量对齐、再以互信息上界解耦,在 COUGHVID 过滤后的 2850 段上取得 95.5% AUC,但仅单数据集验证且 99% 召回的可信度仍待检验。 标签:#音频分类 #变分自编码器 #医疗音频 #可解释性 评分:5.5/10 | 创新 1/2 | 技术严谨 0.7/1.5 | 实验充分 0.6/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5 👥 作者与机构 Ke Zhao:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于将属性映射嵌入(Attribute Mapping Embedding,AME)与变分自编码器(Variational AutoEncoder,VAE)结合,用高斯参数化实现可计算的 Kullback-Leibler 散度(\(D_{KL}\))对齐和互信息(Mutual Information,MI)解耦,思路直观且在小规模咳嗽数据上确实提升了召回率。短板是方法论证与实验支撑均显单薄:仅在 720 例原始音频过滤后的 COUGHVID 单数据集上验证、数学推导存在符号与不等式方向瑕疵、公平性仅靠 t-SNE 定性展示而无定量指标,99% 召回率更像过拟合或划分泄漏的信号而非泛化能力的证明。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1195 words

语音/音乐/音频论文速递 2026-09-01

语音/音乐/音频论文速递 2026-09-01 共分析 49 篇论文 ⚡ 今日概览 ✅ 筛选入选 49 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 8 篇 ████████ #语音情感识别 5 篇 █████ #音乐生成 5 篇 █████ #语音合成 4 篇 ████ #语音增强 4 篇 ████ #音乐理解 4 篇 ████ #说话人日志 2 篇 ██ #音乐转录 2 篇 ██ 📊 论文评分排行榜(49 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Anchoring Speech with Semantics: A Multimodal Adapter… 8.4 前25% 方法研究 #语音识别 🥈 Playability-Aware Audio-to-Tablature Guitar… 8.2 前25% 方法研究 #音乐转录 🥉 When Vocal Tone and Literal Meaning Diverge: An… 8.1 前25% 数据集与基准 #语音情感识别 4. Self-Supervised Pretext Tasks for Infant Cry Analysis… 8.1 前25% 方法研究 #音频分类 5. ImageEval 2026: Culturally Grounded Arabic Multimodal… 8.1 前25% 数据集与基准 #语音识别 6. Perceptually Better, Semantically Worse: Measuring… 8.0 前25% 数据集与基准 #语音增强 7. Vocal Music under Phoneme-Conditional Analysis 8.0 前25% 方法研究 #音乐理解 8. Likelihood-Constrained Acoustic Reranking for Training… 7.8 前25% 方法研究 #语音识别 9. Using Prosody to Predict Syntactic Structure 7.6 前25% 方法研究 #Transformer 10. When Does Predictor-Based RL Align with Human… 7.6 前25% 方法研究 #语音合成 11. V2TATC: A Joint Voice-Trajectory Embedding Framework… 7.5 前25% 方法研究 #对比学习 12. Sequential Trajectories and Simultaneous Blending… 7.5 前25% 方法研究 #语音合成 13. No Detectable Change in Side-Level WER from Prompt… 7.4 前50% 应用研究 #语音识别 14. VocalAffectBench: Evaluating Vocal Emotion Recognition… 7.4 前50% 数据集与基准 #语音情感识别 15. When Models Hear What They Expect: Diagnosing Prosodic… 7.4 前50% 方法研究 #语音情感识别 16. Context-Aware Interleaved Batching for WhisperX 7.4 前50% 方法研究 #语音识别 17. Enabling Proactive Spoken Turns via a Generalized… 7.3 前50% 方法研究 #语音交互 18. MusGU+: Toward a Musician-Centered Evaluation… 7.3 前50% 数据集与基准 #音乐生成 19. Stride-k Subsampling: Train-Free Audio Token Reduction… 7.2 前50% 方法研究 #语音识别 20. TEMPO: Temporally-grounded Multi-task Post-training… 7.1 前50% 方法研究 #音频事件检测 21. VIBE: Video Instruction-aligned Background music… 7.1 前50% 方法研究 #音乐生成 22. Diagnose, Then Refine: A Closed-Loop TTS System with… 7.0 前50% 方法研究 #语音合成 23. HEAR Who Said What: Unlocking Speaker-Attributed… 7.0 前50% 数据集与基准 #说话人日志 24. Evidence-Bounded Mental Health Reasoning from… 7.0 前50% 数据集与基准 #语音情感识别 25. SPHERE: Automatic Music Upmixing via Audio Language… 6.9 前50% 方法研究 #音乐生成 26. Linguistic Distance Segregates Latent Representations… 6.9 前50% 应用研究 #语音识别 27. Closing the Verification Loop: Self-Check Captioning… 6.8 前50% 方法研究 #音频字幕生成 28. Conjoint Audio-to-Spikes Encoding and Processing for… 6.8 前50% 方法研究 #语音识别 29. Neural Multichannel Distant Speaker Diarization and… 6.6 前50% 方法研究 #说话人日志 30. PhysWave: Physics-Guided Latent Diffusion Models for… 6.6 前50% 方法研究 #音频生成 31. What Are You Listening to? Temporal Music Grounding… 6.5 前50% 数据集与基准 #音乐理解 32. CoJEPA: Combining Contrastive Learning and JEPA for… 6.5 前50% 方法研究 #音乐理解 33. Ouroboros: Self-Referential Backdoor Attacks on Speech… 6.4 前50% 方法研究 #语音增强 34. Textual Acoustic Grounding for Generalizable LLM-Based… 6.4 前50% 方法研究 #语音伪造检测 35. Towards Balanced Spectral Reconstruction: Spectrally… 6.4 前50% 方法研究 #语音增强 36. Accurate Plate Reverb Parameter Estimation Using Two… 6.3 前50% 方法研究 #音乐理解 37. Beyond Speech: Dual-Domain SSL Fusion for Unified All… 6.3 前50% 系统技术报告 #音频伪造检测 38. Weakly Supervised Tabla Stroke Transcription via an… 6.3 前50% 方法研究 #音乐转录 39. Language-Statistical Analysis of Neural Audio Codec… 6.3 前50% 方法研究 #语音编码 40. Parallel Time-Band Mixing with Learned Observation… 6.2 前50% 方法研究 #语音增强 41. How Well Do Generative Music Models Follow Emotion… 6.0 前50% 数据集与基准 #音乐生成 42. Multimodal Adaptive Expert Selection with Text Routing… 6.0 前50% 方法研究 #音视频理解 43. Evoking Harmony via Convolution 5.9 前50% 方法研究 #音乐生成 44. DreamX-Creator: Democratizing Native Audio-Video… 5.9 前50% 模型报告 #扩散模型 45. Leveraging Bayesian Optimization for Array Shape Self… 5.7 前50% 方法研究 #声源定位 46. Opinionated, Hesitant and Stressed: Three Studies of… 5.6 前50% 应用研究 #语音情感识别 47. Disentangling Representation using Attributes-based… 5.5 前50% 方法研究 #音频分类 48. Decoupled Latent Flow Matching for Few-Step Joint… 5.3 后 50% 方法研究 #音乐源分离 49. Audio-Driven Adversarial Defense for 3D Talking Face… 4.3 后 50% 方法研究 #语音合成 📋 论文列表 🥇 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages ...

2026-09-01 · 更新于 2026-09-04 · 55 min · 11646 words

Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks

📄 把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗 英文题目:Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks 一句话:为解决人工耳蜗在噪声下可懂度骤降而深度网络又太费电的矛盾,论文把整条 ACE 编码流水线脉冲化为 Spiking Deep ACE,用稀疏加法替代稠密乘累加,在 VSTOI 仅落后约 1 个百分点、SNRi 基本持平的前提下把估算能耗从 2461 降至 372 μJ/s,代价是评估仍停留在声码器客观指标与 45nm 公式估算。 标签:#语音增强 #高效推理 #医疗音频 评分:6.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Ludovic Boulanger:机构信息未在 arXiv HTML 中可靠披露 Sean U. N. Wood:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把 Conv-TasNet 底座的 Deep ACE 整体脉冲化并用 ParaLIF-Threshold 实现时间并行训练的工程取舍清晰,6 倍以上能耗下降对植入体场景确有吸引力。但评估仅在 28 人英语数据上做 ICRA 两类噪声的电极图域指标,无统计检验、无真实 CI 受试者主观验证、无神经拟态硬件实测,能耗也停留在 45 nm CMOS 估算且未计访存,离可植入部署仍有距离。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 1047 words