知の平等と、言葉の覇権(一/全二回)からの続きです。

8年前、Google Books Ngram Viewerを知ったとき、思ったことがあった。

国会図書館のある国であること。その国会図書館がオンラインの利用手続きを受け付けていること。端末を持っているか、持っていなくても利用できる場所、たとえば公共図書館やインターネットカフェなどに行けること。そして、端末を使いこなせること。前提はある。

世の中のすべての書物がデータ化される日が来るのだとすれば、人間社会はいくらか平等に近づくのではないか、と私は考えた。平等とは、フラットな世界ではない。情報はいつの時代も、上から下へとしか流れない。下にいる者は取りに行くしかない。でも、取りに行くには、足かお金が必要だ。両方の場合もある。

デジタル化された書物にアクセスできるならば、足やお金に頼らず、到達できる。足かお金を使わないことが、ここでの平等だ。繰り返すが、情報は上から下へ流れる。ウェブの情報の大元をたどれば、結局は記録物、つまり図書館に行き着く。

実際のNgramには、いまだに日本語が入っていない。英語、ドイツ語、フランス語、ロシア語、中国語、ヘブライ語など、他の多くの言語は対応しているのに、日本語はない。企業秘密だから知る必要もないし、ユーザーには関係のない話だと言われれば、それまでかもしれない。

でも、これは大きな話だと思う。日本語という言語がそこに含まれていないということは、AIの思考の根本が、対応している主要言語、つまり、西洋と中国の思想や価値観に強く引っ張られていくのではないか、という懸念がある。

出版社を退職してからの私は、AIプロジェクトの裏側に関わっている。10年以上になる。海外の大手テック企業の下請け仕事では、募集要項に「Linguistics(言語学)の学位」が書かれているのを何度も見てきた。私にその学位はない。そして、Pythonすらも書けない。

できることが限られる中、活字の業界にいた者として、AIという言葉が市民権を得る前に、その現場に潜り込み、さまざまな仕事をしてきた。今、多くの人が名前を知っている生成AIが、世の中に姿を現す前からのことだ。

そこで見えてきたのは、言葉と、その言葉が背負っている思想の、目には見えない引っ張り合いだ。

ただ、これで終わりというわけでもないらしい。

この度、知ったのだが、国立国会図書館が2022年、独自に「NDL Ngram Viewer」という日本語版を公開していた。公開当初は、著作権保護期間が終わった図書資料、約28万点分のテキストを使った実験サービスだったという。

Googleの巨大な仕組みの外側で、地道にデータを積み上げていた場所が、きちんとあったのだ。この作業の始まりから公開までに関わった方々には感謝しかない。

国会図書館は、やはり国の知を守る場所なのだと思う。

 

Google Ngram Viewer:
https://books.google.com/ngrams

NDL Ngram Viewer:
https://lab.ndl.go.jp/ngramviewer/

 

【お知らせ】2026年8月24日午後9時7分に更新しました。