论文解读
把纠缠的副语言风格拆开学:ParaMETA 的共享空间与任务子空间分工
针对情感、性别、年龄、语言等多副语言任务互相干扰的问题,ParaMETA 用共享 META 正则加任务独立子空间与原型对齐同时做分类与可控合成,最强证据是 LSTM 等骨干上 12/16 个骨干-任务组合最优与性别操控 100% 准确,代价是 META 正则增益不稳定且语言操控几乎无效。
针对情感、性别、年龄、语言等多副语言任务互相干扰的问题,ParaMETA 用共享 META 正则加任务独立子空间与原型对齐同时做分类与可控合成,最强证据是 LSTM 等骨干上 12/16 个骨干-任务组合最优与性别操控 100% 准确,代价是 META 正则增益不稳定且语言操控几乎无效。
针对长录音中说话人、韵律、情感与场景需联合标注的问题,论文用全开源的前端加先验加三智能体加有界复核流程组织标注,并在 8.87 小时九类中文主基准上以时间线与固定时间线两套条件报告了可复述的误差与消融代价。
该研究用男声女声交叉朗读男性刻板、中性、女性刻板长文本检验五款英西汉语音到语音模型,报告输出声音无可靠漂移但说出的性别判断全部跟随内容,错配时集中误判而固定音色审计看不见该偏差。
语音属性识别 | 9.7/10
语音属性识别 | 7.2/10
语音伪造检测 | 6.0/10
语音属性识别 | 6.1/10
语音属性识别 | 6.5/10
语音属性识别 | 5.5/10
语音属性识别 | 5.6/10
语音属性识别 | 7.5/10
语音属性识别 | 6.9/10
语音属性识别 | 7.0/10
语音属性识别 | 4.4/10
语音属性识别 | 5.1/10
语音属性识别 | 5.5/10
语音属性识别 | 5.4/10
语音属性识别 | 5.3/10
语音属性识别 | 8.6/10
语音属性识别 | 5.9/10