第四届全国翻译技术大赛第八期培训已经结束了,没来得及参与直播的小伙伴们不要着急,培训直播回放、内容回顾及模拟题都在这里,欢迎大家学习!
为帮助翻译从业者、爱好者及高校师生进一步了解翻译技术,同时为第四届全国翻译技术大赛参赛者提供备赛参考,中国翻译协会、中国外文局翻译院、吉林外国语大学于5月起启动第四届全国翻译技术大赛系列培训。
第八期培训邀请曲阜师范大学教授秦洪武以《大语言模型支持的语料扩展应用》为题进行讲座。讲座概要如下:
内容回顾
一、语料库的定义与经典应用
(一)厘清概念
大语言模型时代,语料也被看作一种数据。然而,语料库、数据库和大数据,三者在应用目的、数据类型、组织方式、检索方式、使用人群、更新频率、数据完整性规则、规模、访问权限、处理方式等方面存在明显不同。
1. 语料库(Corpus)
语料库是依据既定的建库标准与代表性原则,系统采集大量真实口语(经转写成为文本)与笔语语料,用于分析语言模式、语言用法及词频分布等语言学现象的资源集合。语料库以非结构化或半结构化的文本数据为主体,通常以文件或文本集的形式组织存储,支持语言学赋码、文本标注与语言学分析。检索一般需借助专业的文本分析工具完成。其中的数据多呈静态保存或定期更新的状态,对数据完整性无严格约束,但强调语料规模的充分性。绝大多数语料库面向公众开放使用。
2. 数据库(Database)
数据库是依据预先定义的数据结构,按特定规则收集并组织数据,以实现数据高效存取与规范化管理的资源集合。数据库以结构化数据(呈现为表格、行与字段)为主体,通常采用高度条理化的表结构与关系模型进行组织,并以事务处理为基本处理方式。检索一般借助结构化查询语言(如SQL)完成。其中的数据以经常性或实时更新的方式维护,须严格遵循数据完整性规则,规模因业务需求而定。数据库通常设有存取准入机制,采取权限化访问方式。
3. 大数据(Big Data)
大数据是以海量、高速、多样化为核心特征的数据集合及相关技术体系,需借助专门的分布式技术进行存储、处理与分析,以从复杂数据中挖掘潜在规律、业务洞察与价值信息。大数据以多结构化数据(涵盖结构化、非结构化与流式数据)为主体,通常依托分布式存储系统(如HDFS)以无固定模式组织,并采取批处理与流处理并行的处理方式。检索与计算一般借助分布式计算框架(如Spark)完成。数据以持续的实时流形式更新,对“脏数据”具有较高容忍度(依赖后期清洗保障质量),规模通常达PB级以上,访问基于集群实施权限化管理。
(二)语料库的经典应用
语料库的经典应用领域包括经验性分析、语法和句法研究、词汇研究、话语语用分析、语言变体和演化、语言习得和教学、计算语言学和自然语言处理(Natural Language Processing, NLP)等。各领域研究内容如下:
1. 经验性分析:摒弃主观直觉判断,以海量真实语言实例为依据,客观挖掘语言使用规律、词汇/句式出现频次以及各类语言变体特征。
2. 语法和句法研究:依托真实语料中的完整语句样本,观察各类语法结构在实际场景中的真实使用形态,捕捉常规语法之外的特殊句式、变体用法。
3. 词汇研究:统计词汇使用频次,挖掘词语固定搭配、常用短语组合,归纳词汇间稳定的语义关联与语义韵特征,厘清词汇的真实使用边界。
4. 话语语用分析:对比会话、叙述、学术写作等不同交际语境的语料样本,总结不同场景的语言表达策略、话语组织形式和语用规范。
5. 语言变体和演化:借助分地域、分社会阶层、跨时代的复合分层语料,横向考察方言、不同社会群体的语言差异,纵向追踪语言随时间推移产生的演变规律。
6. 语言习得和教学:从原生语料中提取贴合真实使用场景的典型例句和文本素材,作为教学蓝本,支撑语言教材、课堂练习、教学资源的编写与开发。
7. 计算语言学和自然语言处理(NLP):高质量标注语料是其核心训练数据源,可用于构建大语言模型、语音识别模型、机器翻译系统等各类自然语言智能模型,是人工智能语言技术的底层基础。
语料库在各领域研究中的典型应用可以总结为“频次”和“比较”两大类。“频次”包括词频分析、分布分析、标准化处理;“比较”包括参照语料库对比、历时比较、多维度分析等。
二、大语言模型支持下的语料库转型
语料库存在明显的应用瓶颈,比如细微语感差异、高维语义关联等无法依靠传统计量方法完成分析,无法深入语义层面、难以精准分析语用细节等。语料库依靠表层特征计量评估文本质量,无法捕捉文本的语感、表达创新性和语用适切性,也难以挖掘语料内嵌的丰富文化内涵。
开展语义解读、语感量化等深度语言学剖析,或者构建检索增强生成(Retrieval-Augmented Generation, RAG)外挂知识库、面向垂直领域开展大模型微调等,均要求精准计量语言内部多层级关联特征。基于大语言模型的语料库扩展应用体系应运而生。
大语言模型依赖巨量语料。它通过将词语转换为高维向量,从中学习语言模式,在向量空间中定义词语之间的复杂关系,从而捕捉词与词、短语与短语、句与句甚至更大语言片段之间的统计关系。基于统计关系捕捉语言使用的“规律”,大语言模型才能拥有“预测”能力,可以生成连贯、相关的文本。此外,大语言模型利用余弦相似度等技术,量化句子间的语义关联度,以实现跨语言的语义对齐(如判断两个句子是否为翻译关系)。大规模、精心制作的语料是大语言模型最重要的基础数据。
需要注意的是,大语言模型所呈现的类智能行为,是大规模神经网络在海量文本数据训练下产生的涌现现象,可辅助人类完成逻辑推导、文本推理等脑力工作。生成式自回归模型、掩码语言预训练模型等架构均依靠超大参数量与海量语料拟合涌现出近似推理、生成的行为特征,其底层仅搭载通用数学计算规则,并未人工预设各类场景专属的推理逻辑。
三、语料库的扩展应用
(一)单语语料库
例如从本地语料库检索某一主题相关的表达形式。如主题句检索、多语语义检索或检索特定主题生成知识图谱等。
(二)双语检索
例如在本地语料库中检索双语内容。这为术语提取、多维度译文评估、口语训练智能评估、写作评估等带来新的可能。
大赛报名进行中
报名时间
2026年4月25日至2026年7月18日
报名方式
扫描二维码,开始报名
点击报名链接,开始报名
https://contest.aticicg.org.cn/enroll/h5?channel=8
*转载至公众号【中国外文局翻译院】