辞書編纂学は転換期を迎えています。2026年3月、Google DeepMindは、わずか10,000文のコーパスから、あらゆる言語の完全な辞書項目(定義、語源、使用例、レジスター)を生成できる専門言語モデル「LexiGen」を発表しました。この技術的偉業は、400言語で学習され、ネイティブの言語学者によって微調整された多言語転移学習に基づいています。このプロジェクトは「Universal Dictionary Initiative」と名付けられ、2030年までに民族誌学者によって記録された7,168の現存言語を記録することを目指しています。(出典:Google DeepMind、Ethnologue)

緊急性は現実のものです。ユネスコによると、2週間に1つの言語が消滅しています。世界中で話されている7,168の言語のうち、3,045が危機に瀕しているとされ、573が「絶滅寸前」とされています。これは、数少ない高齢の話者しかその言語を習得していないことを意味します。これまで、言語を記録するには、専門の言語学者による何年ものフィールドワークが必要でした。LexiGenを使用すると、基本的な語彙15,000項目を作成する初期段階は、音声記録と最小限の文字起こしがあれば6週間で完了できます。(出典:ユネスコ「危機に瀕する言語アトラス」)

伝統的にテクノロジーに懐疑的だったAcadémie française(フランス学士院)は、MIT Media Labとの提携を発表し、AIを第9版辞書に統合することに驚きを与えました。このプロジェクトは、アカデミー会員を置き換えるのではなく、彼らのツールとして機能することを目指しています。AIは、現代のフランス語コーパス(ソーシャルメディア、ポッドキャスト、科学出版物)から280億語を分析し、新語、意味の変化、借用語を特定します。2025年には、システムが4,200の新しい用法を検出し、そのうち340が辞書委員会によって採用されました。(出典:Académie française、MIT Media Lab)

商業的応用が拡大しています。2026年1月に8,500万ユーロの資金調達を行ったベルリンのスタートアップLangifyは、企業向けにリアルタイム多言語用語サービスを提供しています。英語で作成された専門用語は、瞬時に120言語に翻訳、定義、文脈化され、同社は97%以上の精度を主張しています。エアバス、シーメンス、WHOが最初の顧客に含まれます。このモデルは、2020年以降売上が45%減少した伝統的な二言語辞書出版社を直接脅かしています。(出典:TechCrunch、Langify)

倫理的な問題が残ります。誰が言語を定義するのか?辞書は常に権力の道具であり、特定の用法を規範化し、他を排除してきました。この規範化を大量のコーパスで訓練されたアルゴリズムに委ねると、支配的なバイアスが強化されるリスクがあります。世界のテキストデータの56%はいまだ英語が占めています。Endangered Languages Projectの言語学者たちは、コミュニティによるガバナンスの必要性を強調しています。辞書項目を検証すべきは、シリコンバレーのエンジニアではなく、ネイティブスピーカーです。AIはツールであり、神託ではありません。言語の多様性は、アルゴリズムだけに委ねるにはあまりにも貴重な遺産です。(出典:Endangered Languages Project、Nature Human Behaviour)