点心杯(AI DimSum Labs):粤语及其内部方言分片的语音识别模型构建
AI DimSum Labs

合作单位

广州大学粤语语料库建设与大模型评测广州市哲学社会科学重点实验室


赛题简介

由广州大学粤语语料库建设与大模型评测广州市哲学社会科学重点实验室发起出题,基于 whisper-small 基线模型,构建粤语及勾漏片方言的语音识别系统,优化低资源方言 ASR 性能。


赛题背景

低资源语言语音识别一直是语音技术研究中的重点与难点。现有研究表明,相较于英语、普通话等高资源语言,少数民族语言、区域方言及其他低资源语言在自动语音识别任务中通常面临标注语音数据不足、文本与词典资源稀缺、数据增强空间有限以及跨场景泛化能力不足等共性问题,因此其模型性能往往明显落后于高资源语言。与此同时,近年来学界也持续探索利用自训练、伪标注、语音合成增强、多语种预训练迁移等方法缓解低资源 ASR 的数据瓶颈,说明该方向具有持续的研究价值与现实意义。

作为两广地区及粤港澳大湾区的重要通行方言,粤语使用人口众多,但在自然语言处理与语音技术领域仍常被视为低资源语言。这一方面与普通话在数字资源和产业生态中的主导地位有关,另一方面也与粤语口语和书面语差异较大、社区内部用字不完全统一、可直接用于训练的高质量语音语料和标注资源相对不足有关。近年的相关研究指出,尽管粤语母语使用者数量庞大,但其高质量数据资源建设仍明显滞后,这一矛盾直接制约了粤语语音技术的发展。

从语言学和应用建模角度看,粤语语音识别还面临若干具有代表性的技术挑战。首先,粤语属于声调语言,声调系统复杂,音节层面的细微差异会直接影响词义区分;其次,粤语自然口语中连读、省音、语流音变等现象较为丰富,增加了声学建模和解码难度;再次,在香港、澳门及大湾区部分城市的真实语音交互场景中,中英文夹杂使用较为常见,相关研究早已指出粤英混合语音识别需要同时处理声学建模、语言建模以及语言边界检测等问题,这使得系统设计明显复杂于单语识别。除此之外,在普通话与粤语并存的应用环境中,如何兼顾语言识别、方言判别与统一建模,也是当前研究的重要议题。

粤语 ASR 技术的提升不仅具有学术研究价值,也具有明确的产业落地意义。在医疗场景中,部分地区已推广“一站式电子服务站”等自助服务设备,用于专科门诊登记与缴费,这类流程天然适合结合粤语语音交互能力,支持自助挂号、报到、分诊问询和缴费引导等应用。 在公共服务和社区健康场景中,香港的精神健康支援热线等服务长期支持粤语,说明粤语语音转写、意图识别和热线辅助坐席技术具有实际需求。 在文旅与城市服务场景中,澳门旅游热线提供粤语服务并覆盖餐饮、酒店、景点、交通等咨询内容,这也表明粤语 ASR 可在景区导览、自助客服、热线接听与游客服务中发挥重要作用。

在此背景下,围绕“粤语及其内部方言分片的语音识别模型构建”开展研究与竞赛设计,具有明显的理论意义和应用价值。一方面,该赛题能够推动参赛者针对低资源方言语音识别中的数据组织、建模策略、迁移学习、鲁棒性优化等关键问题进行探索;另一方面,也有助于促进粤语及其内部不同方言分片语音资源的整理、标准化与共享,提升模型对真实复杂语音场景的适应能力,为医疗服务、政务热线、智慧文旅、智能终端、人机交互等方向提供更加扎实的技术支撑。


实验室主页:https://aidimsum.com

语料库平台:https://search.aidimsum.com


比赛任务

本次竞赛的主题为“粤语及其内部方言分片的语音识别模型构建”

初赛阶段,参赛者需要在 whisper-small 这一基础模型(baseline model)的基础上,基于提供的数据集进行模型效果优化;

复赛阶段,任务进一步贴合实际场景,参赛者在给定的低资源语料集的基础上实现一个语音识别模型。


其他补充


数据集说明

本次竞赛提供以下两个公开的数据集作为训练集:

初赛 — 粤语万句多用途生活场景有声语料集:包含问候、感谢、做客、出行、住宿、就餐、购物、逛街、通讯、邮寄、银行、看病、天气、时间、旅游、运动、兴趣爱好、休闲娱乐、求职、工作、校园、租房、美容美发、问路、聚会应酬、约定约会、情绪表达、常用语、聊天、寻求帮助等各类常见场景。语料集大小约 2 GB。

复赛 — 粤语勾漏片藤县方言口述文化语料集:本语料库收录了广西藤县地区的勾漏片粤语口头表达和文化信息,是一个约43小时、48万字的中小型专用语料库,其核心内容为高质量的田野录音,围绕当地的民间故事、生活习俗、历史记忆等丰富的文化主题开展,具有高度的真实性和自然性。每个录音片段都配有详细的藤县话方言音系的国际音标转写和汉字对照文本及汉语普通话对译文本。该语料库不仅可为方言学、语音学研究提供扎实的基础数据,也是保护和传承藤县地方语言文化的珍贵数字档案,语料集大小约 20 GB。

初赛数据、数据说明和测试脚本等信息可查看 HuggingFace 上的数据集:

https://huggingface.co/datasets/leeduckgo/cantonese-life-scenarios-corpus



扫描二维码进选手答疑群:




点击进入报名参赛