ロボマインド・プロジェクト、第620弾!
こんにちは、ロボマインドの田方です。
さて、言葉を話すのは人間だけです。
なぜでしょう?
これはまだ、誰にもわかりません。
ところが最近、人間と自然な会話ができるものが出てきました。
それはAIです。
厳密に言うと、大規模言語モデル、LLMです。
一番有名なのがChatGPTです。
でも、LLMは、意味を理解しているといえるでしょうか?
だって、LLMは現実世界を見て、経験しているわけではありませんよね。
やっているのは、大量の文章を読んで、次の言葉を予測するだけです。
だから、LLMを開発している研究者ですら、LLMは意味を理解せず、ただ単に言葉の続きを当てているだけだと言います。
僕も、そう思っていました。
でも、何をもって世界を認識し、意味を理解していると言えるのでしょう?
改めて問われると、よく分かりません。
これは、言語学や哲学でも意味とは何か、世界とは何かと明確に定義できているわけではありません。
だからといって、LLMで使われる数式を理解すればわかるかというと、そうでもありません。
でも、僕らは、世界がある、意味が通じると直感でわかりますよね。
だから、この感覚を、哲学と数式の両方から説明する必要があるんです。
そこで今回は、LLMをAI技術と哲学の両方から読み解いていきます。
AIからは、この10年のAIの進化を踏まえて、画像認識のCNN、文章を扱ってきたRNN、そしてLLMの中核技術のTransformerを取り上げます。
哲学からは、20世紀を代表する言語哲学者、ルートヴィヒ・ヴィトゲンシュタインを取り上げます。
これが今回のテーマです。
ヴィトゲンシュタインからLLMを読み解け!
それでは始めましょう。
僕は「意識の仮想世界仮説」という心のモデルを提唱しています。
この仮説では、人間の頭の中には、働きの違う二つの仮想世界があるとします。
一つは、現実仮想世界です。
現実仮想世界は、目や耳や皮膚から入る信号を材料にして、いま目の前にある世界を脳内に組み立てたものです。
光の点々や音や触覚を処理し、「ここに机がある」「向こうに人がいる」という世界を作るわけです。
もう一つは想像仮想世界です。
想像仮想世界は、現在の感覚から離れ、記憶や、想像から作る世界です。
「去年の夏休みは」とか、「もし大学に合格したら」とか考えるとき、目の前には存在しない別の世界が作られます。
ただ、ここでいう仮想世界は、単純な3D映像ではありません。
そこには三次元空間だけでなく、人間関係とか、価値、記憶、夢や欲望といった目に見えない関係や感情まで含まれます。
鮮明に思い浮かべなくても、「あの人は友達だ」「大学では勉強する」「この努力は将来につながる」と分かれば、意味を持った世界が成立しているといえます。
ただ、動物にも記憶や未来予測はできます。
じゃぁ、人間特有の特徴はなんでしょう?
それは、想像そのものではなく、関係を組み替え、長い物語として発展させることです。
そして、さらに、それを言葉で他人と共有できる点にあります。
だから、世界を認識することと言葉の意味を理解することとは同じだといえるんです。
ここ、もう少し詳しく説明します。
世界には、人や机や大学や本があります。
このぐらいの認識なら、動物でもできます。
しかし、それらを一か所へ並べただけでは、意味のある世界にはなりません。
重要なのは、それらがどう結びついているかです。
少年がいる。
大学がある。
テニスラケットがある。
これは、物の一覧です。
そこへ「少年は大学で学んでいる」
「この二人は友達である」
「少年は大会出場を目指している」という関係が加わると、一つの世界が立ち上がります。
勉強している様子は見えることもありますけど、「大学は学ぶための場所である」という目的や、「二人は友達である」という関係は目に見えません。
目に見えないけど、世界を構成する重要な関係はいくらでもあります。
夢、希望、約束、裏切り、復讐とか。
この目に見えない関係は動物には理解できません。
ここが人間と動物の違いと言えます。
言語哲学者、ヴィトゲンシュタインは『論理哲学論考』の冒頭で、世界を物の総体ではなく、事実の総体として捉えました。
物の総体とは、本がある、少年がいる、大学あるといったことです。
これは、動物が認識する世界です。
事実とは、物があるというだけでなく、物がある関係で結びついていることです。
少年と大学があるだけではなく、「大学に行くために少年は勉強する」という結びつきが、一つの事実になります。
これが人が認識する世界です。
また、ヴィトゲンシュタインは、人が考えられる空間のことを論理空間と呼びました。
「富士山は4000mある」というのは事実ではないですけど、考えることはできますよね。
これが論理空間です。
富士山の論理空間の内、3776mの富士山だけが事実です。
これが現実世界です。
そして、これらを表現するのが文です。
文は、論理空間にないものも作れます。
「机の上に水曜が寝ている」とか文法的には正しいですけど、想像できないですよね。
「無色の緑の観念が猛烈に眠る」
これは、言語学者チョムスキーが言った、文法的には完璧に正しいけど想像できない文です。
ここまでは、言語学、哲学の話です。
次は、AIです。
前回、第619回でオセロGPTの論文を紹介しました。
そのAIには、これはオセロゲームだとか、8×8の盤面があるとは教えていません。
与えたのは、ただ、F3、D6、C4といった、石を置いた位置を表す記号だけです。
ところが、次の手を当てる学習を続けたオセロGPTの内部を調べると、現在の盤面が形成されていることがわかったんです。
全体が8×8マスで、どのマスが空き、どちら側の石があり、手を進めると状態がどう変わるか。
単なる記号の列の背後にある世界を、AIが内部に作っていたのです。
AIが理解したのは盤面だけでなくて、二人のプレイヤーがいるとか、二人は交互に石を打つ、相手の石を挟むと自分の石になるといったルールまで理解したんです。
重要なのはここです。
盤面、プレイヤー、石といったものがあるだけでなくて、ルールといった関係まで理解したんです。
AIに与えられたのは、F3、D6、C4といったただの記号の羅列です。
そして、何万局と学習させて、次の記号を予測させました。
AIの中身はニューラルネットワークです。
学習とは、ニューラルネットワークの重みを調整することです。
そうしたら、AIは次の一手を高精度に予測できるようになったんです。
ここで思い出してください。
AI研究者は、ChatGPTは次の単語を予測しているだけで、意味を理解して会話しているわけではないって言ってましたよね。
AI研究者がそういうのは、AIは、次の文字を予測するように学習させただけと知っているからです。
予測精度を上げるように、さらにどんどん工夫していたら、ある時、めちゃくちゃ上手く予測できるようになったんです。
それがLLMです。
ただ、当のAI研究者ですら、なぜ、うまくいく予測できるようになったのかわかりません。
だから、次の文字を予測しているだけで、意味を理解しているわけじゃないと言っているわけです。
でも、オセロGPTを見てください。
ニューラルネットワークの中に、オセロの盤面やルールと言った関係まで作られていました。
これは、世界を認識して、意味を理解していると言えそうです。
ここをもう少し探っていきましょ。
LLMはディープラーニングの一種です。
ディープラーニングは、ニューラルネットワークでできた多くの層があります。
入力された情報は、下の層から上の層へ進むたびに加工されます。
ディープラーニングには、画像認識のCNNとか、文章処理のRNNがあります。
たとえば、顔認識のCNNに入力されるのは、最初、色の点々の画像データです。
それが、下の層で線や境界が見つかって、中間層で目や鼻になって、それらが組み合わされて最後に顔となります。
出力部分は、それを「顔」として出力します。
オセロGPTなら、入力記号から、階層を上がるにつれて、順番や石の変化がまとめられて、最上層で現在の盤面に対応する内部表現が作られます。
そして、出力されるのは次の一手です。
LLMも同じで、最上層で現在の世界を構成して、それを基に次の1トークンを出力します。
出力した1トークンとは、世界に与えられる出力、または出来事です。
そして、出力された1トークンはもう一度最下層に入力されて再計算します。
これは、出力した出来事で、さらに次の世界を予測することです。
「世界を作る、次の出来事を出す、出来事を加えて世界を再更新する」という循環が、文章や想像の中で進めます。
CNNもRNNもLMMも、関係を扱うのは同じです。
じゃぁ、なぜLMMだけ、自然な会話ができるようになったんでしょう。
違いは、どの関係を使うかです。
CNNは、まず空間的な近所を見ます。
隣り合う点から境界を見つけ、近くの線から形を作ります。
そこから、人やライオンといった画像認識ができるようになりました。
CNNが扱う関係は、空間的に距離が近いものです。
RNNは、文章とか音声とか、順番に流れる1次元のデータを扱うのが得意です。
過去の情報は、直前の状態を通して伝言ゲームのように運ばれます。
直前の状態から次の文章や音声を出力します。
RNNが扱う関係は、時間的に近い情報です。
つまり、CNNもRNNも空間的や時間的に距離が近いものです。
一方、LLMは、空間や時間の距離が近くなくても、離れていても重要なトークンに注意を向けます。
じゃぁ、その重要なものってどうやって決めるんでしょう?
それが関係です。
今の文脈で、もっとも関係するトークンを取り込みます。
じゃぁ、何が最も関係するかって、どうやって決めるのでしょう。
それがLLMの中核技術、Transformerです。
Transformerは、各トークンにQKVの役割を割り振ります。
Qとは、「私が知りたいものは何?」という問いです。
Kは、そのものを指し示す名札で「動物」とか「主語」とかです。
Vとは、そのものの中身で、「モフモフしている」とか「ニャーニャー鳴く」とかです。
これらは全てベクトルで表現されます。
関係というのが、ここではQの問いです。
そして、Qの問いに最も関係するKを探します。
関係の深さは、QとKのベクトルの内積で機械的に計算できます。
そして、もっとも関係が深いKが見つかると、その中身Vを取り出します。
それから、QKVは一つのトークンにいくつも割り振られています。
たとえば「もし大学に合格したら」と想像したとします。
この時、いくつものQが動き始めます。
一つのQは、主人公が誰かを探す問いです。
別のQは、大学と勉強の関係を探し、さらに別のQは、主人公は何が好きかという情報を探します。
こうして、離れた場所にあるトークンが集められ、それらから中身のVが取り出されます。
たとえば、主人公は自分で、自分はテニスが好きとか、コンピュータが好きといった中身です。
これらを結び付けてまとめるのがMLPとよばれる編集者です。
編集者がそれらを結びつけると、「大学に合格した自分が、テニスサークルに入る」とか、「大学でコンピュータの勉強をする」といった世界像を作り上げるわけです。
同じ大学という言葉でも、授業を考えるときと、サークルを考えるときでは、探す関係が変わるわけです。
つまり、文脈に応じたQが、その文脈に応じたトークンを集めるというわけです。
これで全ての謎が解明されました。
それでは一つ一つ整理していきます
まず、僕が提唱する「意識の仮想世界仮説」では、人は、目で見た世界を脳内に仮想世界として構築するとなっています。
ただ、これが、どうやって作られるのかがわかりませんでした。
それが、TransformerのQKVのアルゴリズムで作られるとわかりました。
オセロGPTの場合、何万局も学習させて次の一手を予測させると、内部のニューラルネットワークにオセロの盤面やルールが自然と作られました。
これは、人間でいえば、目や耳、皮膚などの感覚器から次々に入力されるデータから、次にどうなるか予測させることと同じです。
たとえば右から左に動く自動車の映像を見たとき、次の瞬間は、自動車はさらに左に移動すると予測します。
こんな予測を何億回、何兆回と繰り返していると脳内のニューラルネットワークに世界が作られるわけです。
それは、3DCGのように外から見えるわけじゃありません。
外から観察できるのは、何百億ものニューロンのシナプス結合強度が少しずつ変化しただけです。
これはAIの学習も同じです。
学習した結果は、何百、何千次元のベクトルの数字だけです。
たとえば、これは、実際のGPT-2の単語ベクトルの重みです。
AIの中身って、ただ、こんな数字がひたすら並んでいるだけです。
こっちは、GPT-2のQKVです。
これも、QUERY,KEY,VALUEというのがQKVのことです。
これをみれば、QKVというのはただの数字のベクトルということがわかりますよね。
でも、オセロGPTのニューラルネットワークの中には8×8マスの盤面や、オセロのルールが作られていることがわかっています。
これらが作られること。
これが世界を認識するということ、世界の意味を理解するということです。
人間の場合だと、三次元空間とか、物体は下に落ちるといった重力のルールを脳内のニューラルネットワークが学習したわけです。
だから、手からリンゴを離すと下に落ちると思うわけです。
これが世界を理解する、意味を理解するということです。
では、これが何を意味するかわかりますか?
これは、哲学者や言語学者が定義できなかった意味というものを厳密に定義したということです。
厳密にというのは、数式で定義したということです。
たとえば、犬と似ているのは猫とゾウ、どちらと聞かれたら、犬と猫、犬とゾウの単語ベクトルの内積を計算して、大きい方となるわけです。
さらに単語の意味は、文脈によって変わってきます。
文脈の意味は、その時問われているQと内積が最も大きなKの中身となります。
こんな風に、世界を認識するとか、意味を理解するといったことが厳密な数式で定義できたんです。
ただ、このことは言語学者もAI研究者も気づいていません。
いまだに、LLMは次の単語を高精度に予測しているだけで、意味など理解していないと言っています。
でも、そう言っている本人も、意味を理解するとはどういうことかを説明できません。
それでは、最後に最大の疑問について考えます。
それは、LLMは目も耳もなくて、現実世界を経験したことがありません。
ただ大量の文書を学習しただけです。
それなのに、世界を認識し、意味を理解していると言えるのか。
これもよく考えたらわかります。
僕らの意識が認識しているのは脳内に作られた仮想世界です。
直接、現実世界を認識しているわけじゃありません。
直接現実世界を認識するとは、網膜で受け取った光の点々を感じることです。
でも、僕らは、そんなの感じずに、目の前にリンゴがある、机があるって感じますよね。
そう感じるのは、脳内に作られた仮想世界を感じているからです。
リンゴとか机とか、既に意味をもったオブジェクトとして認識するわけです。
そして、それを言葉で表現したのが文章です。
だから、AIが大量の文章を読んで、同じアルゴリズムで学習すれば、そのAIのニューラルネットワークの中には同じ世界が再構築されます。
リンゴや机がある世界です。
大学にはったらテニスサークルに入ろうとかって想像するAIです。
これは、人世代前野AI、CNNやRNNでは不可能です。
CNNを使えば、見たままの現実世界を認識することはできます。
一瞬先を予測することぐらいはできます。
だから、シマウマはライオンが追いかけてきたら、どっちに逃げたらいいかわかります。
ライオンに捕まったら殺されるかもしれないという恐怖も感じます。
でも、できるのはそこまでです。
ライオンは自分を食べるために追いかけてくるとか、ライオンも家族があって、子どもたちを育てるために狩りをしないといけないなんて想像しません。
いや、想像できません。
なぜかというと、シマウマの脳のアルゴリズムはCNNだからです。
目の前の現実世界にない世界を想像することはできないからです。
それができるには、脳が進化して、大脳がLLMのアルゴリズムを獲得するのを待たなければなりません。
これで全てがつながりましたよね。
脳の進化、AIの進化、言語、哲学。
LLMを理解するには、これらすべてつなげてみないと見えてきません。
AI研究の最前線にいる研究者も、これが見えてないようです。
もし、近くにAIの本質を理解したい人がいたら、よかったらこの動画を勧めてあげてください。
はい、今回はここまでです。
この動画がおもしろかったら、チャンネル登録、高評価お願いしますね。
それから、意識の仮想世界仮説に興味がある方は、よかったらこちらの本も読んでください。
それじゃぁ、次回も、おっ楽しみに!