词典学正在进入一个突破性时代。2026 年 3 月,Google DeepMind 发布了“LexiGen”,这是一种专门的语言模型,能够仅根据 10,000 个句子的语料库,为任何语言生成完整的词典条目——定义、词源、用法示例、语域。这项技术突破基于一种多语言迁移学习,该学习在 400 种语言上进行训练,并由母语语言学家进行精炼。该项目被称为“通用词典倡议”,旨在到 2030 年记录 Ethnologue 记录的 7,168 种活语言。(来源:Google DeepMind,Ethnologue)

紧迫性是真实存在的。根据联合国教科文组织的说法,每两周就有一种语言消失。在全球使用的 7,168 种语言中,有 3,045 种被认为是濒危语言,573 种被认为是“极度濒危”——这意味着只有少数年长的使用者仍能熟练掌握它们。迄今为止,记录一种语言需要专门的语言学家进行多年的实地工作。使用 LexiGen,如果能获得音频记录和最少的转录本,启动阶段——创建包含 15,000 个词条的基本词汇——可以在六周内完成。(来源:联合国教科文组织濒危语言地图集)

法兰西学院是一个传统上对技术持怀疑态度的机构,它出人意料地宣布与麻省理工学院媒体实验室建立合作关系,将人工智能整合到其词典的第九版中。该项目旨在为院士们提供工具,而不是取代他们:人工智能分析来自当代法语语料库(社交网络、播客、科学出版物)的 280 亿个单词,以识别新词、语义演变和借词。2025 年,该系统检测到 4,200 个新用法,其中 340 个被词典委员会保留。(来源:法兰西学院,麻省理工学院媒体实验室)

商业应用正在激增。2026 年 1 月获得 8500 万欧元融资的柏林初创公司 Langify 为企业提供实时多语言术语服务:一个用英语创建的技术术语可以立即被翻译、定义和情境化为 120 种语言,其精度据该公司声称高于 97%。空客、西门子和世卫组织是其首批客户。该模型直接威胁到传统的双语词典出版商,自 2020 年以来,他们的营业额下降了 45%。(来源:TechCrunch,Langify)

道德问题依然存在:谁来定义一种语言?词典一直是权力工具,它对某些用法进行编码,而将其他用法排除在外。将这种编码委托给在大量语料库上训练的算法,可能会强化主导偏见——英语仍然占全球文本数据的 56%。濒危语言项目项目组的语言学家强调社区治理的必要性:应该由母语使用者,而不是硅谷工程师,来验证词典条目。人工智能是一种工具,而不是神谕——语言多样性是一种可贵的财富,不能仅仅交给算法。(来源:濒危语言项目,自然人类行为)