谢旭荣现任中国科学院软件研究所人机交互技术与智能信息处理实验室副研究员。他在香港中文大学电子工程系获得博士学位,并先后在中国科学院深圳先进技术研究院、香港中文大学系统工程与工程管理系工作学习。研究方向包括障碍语音处理、自适应技术、语音和语言建模、神经语音解码等,在相关领域发表期刊及会议论文60余篇,提出的神经网络声学模型贝叶斯自适应技术获ICASSP 2019最佳学生论文奖,语音基础模型障碍语音识别与检测技术论文入选IEEE SPS 2024–2025年TASLP期刊Top 25下载论文,以及获ISCSLP 2024多模态构音障碍严重程度评估挑战赛奖项、HHME优秀论文等。
承担国家自然科学基金青年项目、新一代人工智能重大项目子课题、国家重点研发计划项目子课题、中国科学院软件研究所重大项目子课题、中国科学院青年创新促进会会员项目等国家和中科院科研任务。
近几十年来面向正常语音的自动语音识别(ASR)技术取得了飞速进展,但对构音及认知障碍语音的精准识别仍属极具挑战的任务。构音障碍是一类常见的言语运动障碍,常由脑瘫、肌萎缩侧索硬化症及脑卒中所致的运动控制异常引发;阿尔茨海默病等神经认知障碍在伴有言语-语言功能受损的老年群体中亦十分常见。
面向障碍用户需求定制的ASR技术,不仅能够显著提升其生活质量、辅助康复,还可支持对神经认知功能障碍的自动化早期诊断。当前ASR技术主要针对健康非老年用户的正常语音设计,而构音及认知障碍语音为其带来诸多挑战,主要包括:因运动控制异常及衰老过程导致的与正常语音间的显著声学失配;数据采集困难所导致的数据稀缺问题;说话人层面的高度异质性。
预训练语音基础模型已被广泛应用于各类ASR任务,然而采用数据密集型参数微调方式将其迁移至障碍语音场景,则会面临领域内数据稀缺与分布失配的双重难题,极易引发性能及泛化性能下降。因此需要设计专用的系统结构、模型表征、以及训练和建模方法等以解决上述问题,如面向障碍语音的模型融合方法、离散token表征、半监督学习方法、以及自适应建模技术等。