コアレッセント理論モデルによるバントゥー語族の歴史の分析:水平方向の言語接触が早期の多様化の痕跡を消去した

背景
人類の移動や文明の広がりを追跡する際には、考古学、遺伝学、言語学の学際的な協力が不可欠である。アフリカのサハラ以南の地域を網羅するバントゥー語族の拡大は、人類の歴史における最大規模の言語拡散イベントの一つと考えられている。多数の学者が、この言語族の早期多様化プロセスの解明に尽力してきた。従来の系統樹的アプローチは、主に生物学的多様化のモデルから借用した樹状解析に依存してきた。この方法論は、言語が分岐する際、隣接するグループとの相互作用がほとんど、あるいは全くなかったという前提の下で機能している。
しかし、生物種とは異なり、言語は水平伝播を頻繁に経験し、近隣グループとの接触によって語彙が混ざり合う。バントゥー語族は、その歴史を通じて、異なるグループ間で広範な相互作用と言語の交換を経験した可能性が高い。こうした言語接触を除外する単純な系統樹モデルは、言語の真の進化の軌跡を歪める可能性がある。従来の分析では、言語接触を単なるノイズとして扱い、バントゥー語族が数千年前に入り乱れてどのように多様化し拡散したのかについて、明確な結論を導き出すことができなかった。実際の相互作用、すなわち語彙の混合を計算モデルに完全に組み込むことが極めて重要である。
主な発見
パトリシア・サントス(Patrícia Santos)博士が率いる多国籍研究チームは、集団遺伝学で元来開発されたコアレッセント理論(合祖理論)言語学に応用した。チームは、言語接触を自然な進化プロセスとして扱う新しい数学的計算モデルを提案している。このモデルは、遺伝学からの遺伝子流動と突然変異の概念を取り入れ、それぞれ言語間の語彙的借用と独立した語彙の変化率として表現している。このモデルを検証するため、研究者らは近似ベイズ計算(ABC)アプローチを採用し、実際のバントゥー語族の語彙データと比較した。
分析は驚くべき結果をもたらした。バントゥー語族の現在利用可能な語彙データは、初期の歴史的情報の大部分を失っていることが明らかになった。バントゥー語族内の語彙の変化率と言語接触の強さは、予想をはるかに上回っていた。この急激な変化と頻繁な接触によって、言語多様化の初期段階からの本来のシグナルが完全に覆い隠されてしまったのである。その結果、現在利用可能な語彙データセットのみを使用してバントゥー語族の初期多様化の歴史を再構築することは、現在では不可能である。
意義と展望
本研究は、人類の移動ルートの再構築を目的とした学際的研究に対して、深刻な警告を発するものである。これまでの考古学や遺伝学の研究では、仮説を検証するための三角測量ツールとして言語系統解析が使用されてきた。しかし、言語データ固有の語彙の混合により初期の系統再構築が根本的に不可能になるのであれば、それに基づいた仮説も同様に疑問視される。研究チームは、バントゥー語族の言語多様化の構造を、先史時代の人類史を再構築するための決定的な証拠として軽率に引用すべきではないと明言している。
今後の研究は、語彙に加えて、接触の影響を受けにくい文法構造や音韻的特徴などの言語的マーカーを組み込むことによって、モデルを洗練させることに焦点を当てるべきである。バイオインフォマティクスにおける系統ゲノム解析が単一遺伝子解析の限界を克服したのと同様に、言語学においてもマルチマーカーモデルが開発されるべきである。検証された数学的フレームワークは、アフリカだけでなく、先住民族の言語やユーラシアの大規模な言語ファミリーの分析にも有用に応用できる。言語学の限界を認めることにより、先史時代のより正確な再構築への道を切り開くことができる。
Proceedings of the National Academy of Sciences, Volume 123, Issue 31, August 2026. SignificanceWe build a coalescent-theoretic model for studying the early prehistory of the Bantu language family. Prior computational phylogenetic work on the Bantu uses models that assume that language contact is absent or negligible. In contrast, we ...
このモデリング手法は、人類の歴史の研究だけでなく、多言語翻訳を処理する自然言語処理(NLP)人工知能(AI)の性能向上にも応用できる。現代の大規模言語モデル(LLM)は、歴史的接触が頻繁な多言語環境において単語の意味的類似性を評価する際にエラーを起こすことが多い。有望な代替案は、コアレッセント理論に基づく水平接触計算アルゴリズムをLLMのトレーニングプロセスに組み込むことである。例えば、複数のバントゥー語とアラビア語が融合したスワヒリ語のような複雑な多言語環境において、モデルは各語彙項目の起源と導入時期を追跡でき、それによって翻訳エラーを最小限に抑えることができる。さらに、危機に瀕した少数言語の語彙損失パターンの予測や、効果的な言語復元シナリオの設計を支援することが可能になる。