先日、あるニュースが話題になっていた。AI企業が、古い書物を大量に買い集め、スキャンして学習データにしているという記事だ。

世間は驚いていたようだが、私は、「そうかそうか」という気持ちだった。

実は、私のところにも似た仕事のオファーが、過去に2回来たことがある。古書や希少本をスキャンして学習データにする、という内容だった。結局、どちらも立ち消えになったが、彼らはとっくに嗅ぎつけていたのだと思う。本当に価値のある知は、インターネットの表面にはなく、神保町や、全国の昔ながらの古書店の棚に眠っていることを。

Geminiに向かって、「神保町の古本、全部買い漁ってスキャンして学習しなさいよ」と、怒っていたことがある。まだBardと呼ばれていた頃だったかもしれない。

このニュースを読んで、あるものを思い出した。下書きに戻した古いブログの投稿を探してみると、出てきた。2018年12月2日にミネルヴァ書房の『はじめて学ぶ方言学』を紹介していた。

当時の私は「ヤポネシアゲノム」という研究チームのプロジェクトに夢中で、参加している先生方の本を片っ端から読み漁っていた。今でも、斎藤成也先生をはじめとする、ほかの先生方の新刊を心待ちにしている。

読んだ中の一冊、木部暢子先生らの編著書で出会ったのが、「Google Book Ngram Viewer」だった。西暦1500年代から現在までの、言葉の流行りすたりをグラフで見られる機能だ。

西暦1500年代からという区切りを見るたび、私はグーテンベルクの活版印刷を思う。人間の言葉が大量に複製され、「記録」として積み重なっていく時代の始まりと、どこか重なって見える。

言語学という学問への薄い関心は、もっと昔からあった。受験生の頃に通っていた新宿にある塾の先生が、東京教育大学でそれを修めた人だった。先生は、英語をユーモアたっぷりに教える天才で、英語表現を日本語に置き換える独特の覚え方は、いつの間にか他の予備校でも使われるほど広まっていた。インターネットで検索すると、今も現役で教えられているようでうれしい。

Google Ngram Viewer:
https://books.google.com/ngrams

 

【お知らせ】2026年8月24日午後9時3分に更新しました。