DIY e-HandPan: A new DIY Low-Cost Handpan Interface based on Arduino and ESP32 Microcontrollers

📄 DIY e-HandPan: A new DIY Low-Cost Handpan Interface based on Arduino and ESP32 Microcontrollers 标签:#音频交互 #端到端 #实时处理 #开源工具 #教育 7.2/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 0.7/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音频交互 | #端到端 | #实时处理 #开源工具 | arxiv 👥 作者与机构 第一作者:Benoît Collin(IBISC, University of Évry Paris-Saclay) 通讯作者:论文未明确标注通讯作者,仅提供联系邮箱 dominique.fourer@univ-evry.fr 作者列表: Benoît Collin(IBISC, University of Évry Paris-Saclay) Dominique Fourer(IBISC, University of Évry Paris-Saclay) Eric Genotelle(IBISC, University of Évry Paris-Saclay) 💡 毒舌点评 作为开源硬件系统报告,工程文档完整度相当扎实:用约 80 美元做出了带力度感知、双色 LED 教学引导和双 MCU 版本的电子手碟,对音乐教育与 Maker 社区有实际价值。但论文几乎没有对端到端演奏延迟、误触发率、长期可靠性和学习效果做量化评估,与 Panduino、Lumen、Neotone 等已有系统只停留在属性表对比,摘要中“表现力可比原声手碟”的说法没有任何对比数据支撑,离顶会“证据支撑结论”的标准还差得远。此外,Arduino 版本是否支持 LED 教学在正文中自相矛盾(2.3/4.2/5.1 描述与 3.1 矛盾),需要认真修正。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 701 words

Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books

📄 Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books 标签:#音频生成 #大语言模型 #音频交互 #零样本 #游戏音频 7.0/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音频生成 | #大语言模型 | #音频交互 #零样本 | arxiv 👥 作者与机构 第一作者:Karim Benharrak(University of California, Berkeley) 通讯作者:未说明 作者列表:Karim Benharrak(University of California, Berkeley)、Oriol Nieto(Adobe Research, San Francisco)、Bryan Wang(Adobe Research, Seattle)、Zeyu Jin(Adobe Research, San Francisco)、Amy Pavel(University of California, Berkeley) 💡 毒舌点评 把面向对象编程搬到音频剧剪辑台上是一次聪明的抽象跃迁,9.7×编辑放大和约4倍时间缩减足以让DAW厂商坐不住;但整套系统建立在ElevenLabs、Gemini 3 Pro以及其他闭源生成模型之上,对象级传播完全交给LLM却不给出任何可靠性度量,N=8固定顺序的受试设计又让"显著降低任务负荷"的因果故事无法完全闭合。审稿人在点头之余,始终悬着一个无法验证的问号。 ...

2026-08-11 · 更新于 2026-08-14 · 2 min · 294 words

Beyond Call and Response: Modelling Reciprocal Coordination in Human-AI Vocal Ensembles

📄 Beyond Call and Response: Modelling Reciprocal Coordination in Human-AI Vocal Ensembles 标签:#歌唱生成 #生成模型 #音乐理解 #音频交互 5.5/10 | 创新 1.3/2 | 严谨 0.9/1.5 | 实验 0.4/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #歌唱生成 | #生成模型 | #音乐理解 #音频交互 | arxiv 👥 作者与机构 作者列表:Polina Proutskova(Industry Commons Foundation,Stockholm,Sweden) 唯一作者:Polina Proutskova 通讯作者:未单独标注;文首提供邮箱 polina.proutskova@industrycommons.net 机构:Industry Commons Foundation,Stockholm,Sweden 💡 毒舌点评 把“无指挥、无伴奏人声重唱”重新定义成没有外部时钟的多对多递归协调问题,并拿非等时性作为硬案例,这个视角确实比常见的“听-回应”音乐 AI 框架更贴近真实集体演唱。但整篇目前基本是一份研究议程:VocalLanes 只完成了采集和对齐,符号表示仍在开发中,状态推断、影响建模、AI 代理与比较评估全部处于 proposed 状态,关键声明没有任何端到端验证。以顶会标准看,缺的不是问题意识,而是能把“协调”落实到可测量结果上的实验闭环。 ...

2026-08-10 · 更新于 2026-08-14 · 3 min · 427 words

Deep Learning for Real-Time Sound Order Recognition in Human-Robot Interaction

📄 Deep Learning for Real-Time Sound Order Recognition in Human-Robot Interaction 标签:#音频事件检测 #CNN #音频交互 #实时处理 #鲁棒性 5.2/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.7/1.5 | 清晰 0.6/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.2/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #CNN | #音频交互 #实时处理 | arxiv 👥 作者与机构 第一作者:Rezaul Tutul(Berliner University of Applied Science, Berlin, Germany) 通讯作者:未说明;论文首页标注第一作者邮箱 rezaul.tutul@bht-berlin.de 作者列表:Rezaul Tutul、Usaid Khan、André Jakob、Ilona Buchem(均署名 Berliner University of Applied Science) 💡 毒舌点评 把“谁先发声”定义成一个可学习任务,并用多特征分支加注意力融合做到99%,是合成条件下有启发的起点。但整篇论文的核心证据只来自一张“最佳准确率”表:baseline数值缺席、注意力消融缺席、分延迟准确率缺席、真实房间验证缺席。STFT幅度谱帧移为8ms,论文却要解决0.4ms级别的onset差异,既没有给出机制分析,也没有给出随延迟变化的性能曲线。当前证据更适合支撑“合成数据上的技术报告”,而不是“可靠识别声音顺序”这一强结论。 ...

2026-08-06 · 更新于 2026-08-14 · 2 min · 249 words

Embodied Empathy: A Multimodal AR and LLM-Powered System for Self-Attachment Psychotherapy with Self-Initiated Humour

📄 Embodied Empathy: A Multimodal AR and LLM-Powered System for Self-Attachment Psychotherapy with Self-Initiated Humour 标签:#音频交互 #大语言模型 #语音识别 #音频理解 #Transformer 5.4/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 5.4/10 | 后50% | 文档类型:应用研究 | 评分置信度:高 | #音频交互 | #大语言模型 | #语音识别 #音频理解 | arxiv 👥 作者与机构 第一作者:Xinyan Ye (Imperial College London) 通讯作者:未说明 作者列表:Xinyan Ye (Imperial College London)、Gwyneth Phang (Imperial College London)、Anandha Gopalan (National University of Singapore)、Abbas Edalat (Imperial College London) 💡 毒舌点评 这篇论文的工程雄心值得肯定,将一个心理学疗法从碎片化的VR+网页聊天变为移动端一站式AR体验,技术整合度和完整度不错,用户对TTS的偏好也提供了一个有参考价值的发现。但作为声称要发表在顶会(ICMI,此处目标会议为ICMI Companion,并非主会)的研究,它在实验设计和学科交叉上几乎犯规:八天N=16的非临床研究,只有Likert量表而无任何标准临床指标,情绪识别模型用公开数据集跑出的95%准确率在真实文本中直接导致用户反馈“奇怪和出乎意料”的体验,而核心的“幽默疗法”却没有任何幽默感相关的量化度量,这种“系统写了但疗效全靠用户自己说”的验证逻辑,放到严肃的数字疗法领域会让人产生一种看了个精美demo视频的错觉。 ...

2026-08-04 · 更新于 2026-08-14 · 2 min · 369 words

Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

📄 Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis 标签:#音频交互 #提示学习 #音频大模型 #音频理解 #Transformer 7.0/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频交互 | #提示学习 | #音频大模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Jiachen Qian(City University of Hong Kong) 第二作者:Junyu Li(City University of Hong Kong (Dongguan)) 通讯作者:未说明 其他作者信息:无 💡 毒舌点评 这篇论文用一个干净利落的受控实验,把音频LLM安全评测中“文本和语音传递混为一谈”的致命问题拎了出来——固定有害文本,只靠变韵律就能让越狱成功率从4%飙到40%,这个insight足够让只会做文本红队的人冒冷汗。但很可惜,作者为了“防滥用”把整个数据集和代码藏得严严实实,读者只能靠一份“食谱”自己在家复刻,而这“食谱”又深度绑定Azure TTS和特定的说话人预设,换个TTS引擎效果还剩多少完全靠猜。此外,机理分析虽然画了漂亮的“拒绝方向”箭头,但更像是给现象贴了个几何外观的标签,离真正的因果解释还隔着好几层。 ...

2026-07-30 · 更新于 2026-08-14 · 3 min · 460 words