7月19日,由世界人工智能大会组委会指导,数传集团、上海国有资本投资有限公司、GOMAX LAB骨码智元实验室联合主办的人工智能高质量语料生态论坛于世博中心举办。这是GOMAX LAB首次面向全球完整发布垂域高质量语料共建体系,也是本届WAIC院士参与数量最多的论坛——共25位院士出席。
中国工程院院士、广州大学网络空间安全学院名誉院长方滨兴在主题分享中重点介绍“粤语语料库建设与大模型评测重点实验室”,他指出,数据决定粤语AI的上限。
“大模型真的懂粤语吗?主流模型都能做粤语的生成,但只是能说几句粤语,并不等于真正懂粤语。”方滨兴说,“表面会”和“真正懂”之间,有一条由浅入深的能力链。既要理解词汇和句子的基本含义,还要感知语气、语调和情感态度;既要识别使用场景逻辑条件,也要理解语言背后的文化背景、价值观与社会规范;既要解析不同地区用词发语和表达习惯,还要把握说话者真实意图与社会任务目标,只有这些能力都相互贯通,大模型才谈得上真正懂粤语。
他指出,制约大模型能力的并不在于模型大小,也不在于算法效率或算力环境,而在于缺少高质量、成规模、可持续增强的粤语大模型训练语料集。
他说,面向人工智能的通用语料库正当其时:在技术上,大模型竞争正在从拼参数转向拼高质量数据,场景能力和数据共生,数据侧投入也日益成为决定竞争格局的一个关键的变量;在应用上,粤港澳大湾区政务、客服、教育、医疗、媒体与内容生产等领域粤语需求也快速增长,应用场景正在牵引着数据建设;在评测上,模型不能只会用粤语作答,必须进入是否理解粤语本身的系统性评测阶段。评测升级倒逼数据和模型升级,治理上来源合规、投毒防护、隐私保护和供应链安全等要求持续提升,推动语料基础设施走向规范化。
当前,广州正推进建设“垂类模型之都”,备案大模型数量已在全国城市排在第三,深入嵌入应用场景是广州备案大模型的重要特色。方滨兴说,广州应该充分利用本地丰富粤语资源,为全球粤语AI提供新型的通用粤语语料库这一公共基础设施。
他指出,高语量粤语综合价值显而易见,要从提高语言纯度,提高信息密度,降低训练成本,以及训练方向等方面下功夫来推进。关键是要做好大语言“八道工序”:采、验、洗、标、分、评、用、回,多元采集,来源验证,清洗去噪,多层标注,分类分级,质量评估,模型使用,效果回流,最终沉淀形成训练数据、任务数据、评测及安全样本四类资产,将来源合规、语言真实、标注一致性、版本可追溯四项质量要求贯穿始终。其本质是把原始语料加工成为一个可训练、可评测、可审计的数据资产,最终形成一套贯穿采集、治理、标注、评测、安全与应用的全链路的平台体系,来做到数据模型评测、安全一体化的平台。
粤语的评测则应该建立“八维”体系:识、听、说、懂、知、推、用、安,识就是识别粤语的字词、口语表达与书写的变体,听就是理解粤语的语言、口音与连续语流,说就是生成自然、地道、流畅的粤语表达,懂就是理解语义、预期、场景和含义,知是掌握粤语相关知识文化与地域背景,推是在粤语语境下完成判断、归纳和推理,用就是在问答对话抽取等任务中稳定可用,安是要避免幻觉、偏见、违规与高风险输出。
他指出,粤语数据基础设施建设应该按照建得起来、用得起来、持续变强这三个阶段来递推:
第一个阶段是重新搭建底座,把数据收进来、管起来,完成多元汇集、来源合规、清洗去重、基础标注以及首版评测。
第二阶段重稳定应用,使数据能够支撑训练评测与行业适用,形成训练包、任务集、评测报告与试点案例。
第三阶段重持续进化,形成数据模型的安全闭环,实现缺口发现、回流补采、动态任务生成以及版本迭代,全过程需要组织机制、语言专家、数据共生行业专家、安全合规等6个方面的力量来投入。
他指出,落地推进上可以采用“1+N+X”的协同机制,依托通用粤语数据通用基础设施核心平台来牵引政务服务、教育、医疗、媒体内容、客户服务、文旅传播等N个行业场景,支持智能助手、知识问答、内容生成评测工具、风险审计、训练服务等X类的应用终端,形成从广东先行试点到大湾区协同扩展再到可复制推广的扩展路径,平台化建设要与场景应用联动,才能推动粤语数据从资源转化为能力。
南方+记者 郜小平