第619回 AIも世界が存在すると思っていた。


ロボマインド・プロジェクト、第619弾!
こんにちは、ロボマインドの田方です。
あなたは、今、自分は部屋の中にいるとか、目の前に世界があると思っていますよね。
だって、目の前に部屋とか世界が見えますから。
でも、見えるからと言って、本当に世界が存在するとは言えません。

たとえばライントレーサーで考えてみます。
ライントレーサーは、白い床に描かれた黒い線に沿って走るロボットです。
左右に、目の代わりになるセンサーが付いていて、センサーでラインを感じ取って走ります。
第619回YouTube原稿の説明図。図1 ライントレーサーは世界を見て走っているのか?
ライントレーサーが走る様子を見たら、こう思うかもしれません。
「このロボットは、世界とは白い床と、そこに描かれた黒い道だ。
自分は、今、黒い道に沿って走っている」

でも、ちょっと考えたらそうじゃないことがわかります。
ライントレーサーがやっているのは、左のセンサーが黒を感じたら、少し左へ。
右のセンサーが黒を感じたら、少し右へ。
これだけです。
床があるとか、世界があるとかなんて考えたこともありません。
あるのは、センサーから送られてくるデータと、そのでータに応答してモーターを回す命令だけです。

そう考えると、目があるから世界があると認識できるわけじゃないってことがわかりますよね。
だって、網膜から送られてくるのは赤とか青のただの色データだけですから。
じゃぁ、どうやったら外の世界は3次元空間だとか、空間の中に自分がいるって思えるんでしょう。
考えたら不思議です。

ここで、ちょっとおもしろい論文を紹介します。
それは、ハーバード大学の研究チームが発表したオセロGPTという論文です。
オセロって、8×8のマス目に白と黒の石を順番に置くゲームですよね。
 
横をA~H、縦を1~8とすれば、マスの位置は「E3」とかって記号で定義できます。
すると、ゲームの進行は、E3、F5とかって石を置いて行った順番で表せますよね。
研究では、この記号の並びだけをAIに学習させました。
ただし、学習させたのは、2000万局もの膨大なデータです。
そしたら、内部のニューラルネットワークに8×8マスが作られていることが確認できたんです。
これ、考えたらすごいことです。
だって、AIは、この記号の並びがオセロの手を示しているとか教えられていないんですよ。
それどころか、マス目があるとか、そこに石を順番に置くといった超基本的なルールすら教えていません。
それなのに、8×8のマス目があるって理解したんです。
つまり、外から入力される記号の並びだけで、この世界は、8×8のマス目でできているって理解したんです。
それだけじゃないですよ。
マス目に自分と相手が交互に石を置くとか、自分の石で相手の石を挟むと、相手の石は自分の石になるってルールまで理解したんですよ。
すごいですよね。
しかも、これ、人間にも当てはまりますよね。
僕らは、この世に生まれたとき、この世界は三次元の空間だってことを知りません。
ただ、網膜から脳にデータが送られてくるだけです。
網膜から送られてくるデータは位置と色を表す一種の記号です。
脳は、それが位置を表すのか、色を表すのかすら知りません。
ただ、何らかの情報処理をすることで、この世界は3次元の空間だと理解するわけです。
ただ、自然に行っているから、目を開けるだけで、目の前に部屋がある、世界があると思うわけです。
世界があると思える情報処理、その仕組みを知るには、AIに聞くのが一番早いです。
これが今回のテーマです。
AI世界が存在すると思っていた。
それでは、始めましょう!

さて、オセロGPTはLLMでできています。
つまり、大量の文書を読むことが得意です。
ただ、今回読ませたのは文章でなくて、オセロゲームの手です。
つまり、石が置かれた位置とその順番だけです。
たとえば、E3、F5、D6、C4……といった文字列です。

AIは、世界は8×8のマス目でできているとか、ゲームをしているなんてことは知りません。
AIの中で起こっていることをたとえると、窓から次々にデータが送り込まれる真っ暗な部屋です。
第619回YouTube原稿の説明図。図2 記号の列しか見ていないAIの内部に、盤面が立ち上がる
その中で、データを分析することで、外の世界がどうなっているのか予測するんです。
ただし、外の世界を予測せよと指示されたわけじゃありません。
指示されたのは、入力されたデータから、次に来るデータを予測せよです。
ただ、次のデータを高精度に予測するためには、外の世界がどうなっているのかわからないといけませんよね。
そこで、AIの中に外の世界のモデルが自然とできたんです。
たとえば、入力されたデータがオセロのデータなら、AIのなかにオセロのモデルが自然と浮かび上がるんです。
これだけじゃよくわからないとおもうので、AIの内部でどんな計算をしているのか詳しく解説します。
実際の中身は数式だらけですけど、今回は数式は一切使わず、小学生でもわかるように解説するので安心してください。

さて、AIの中には、E3とかって記号が入力されました。
最初、このE3という記号には何の意味もありません。
「Eは横、3は縦」なんてことも知りません。
まず、E3は、意味のない512個の数字の並びに変換されます。
これを512次元のベクトルと呼びます。
最初は、ほとんどデタラメな数字です。
ところが2000万局ものデータを使って、次の手を何度も何度も予測させます。
予測を外したら数字を少し直します。
また外したら、また少し直します。
これを途方もない回数、繰り返します。
すると、ただの数字に、少しずつ役割が生まれてきます。

ここで働くのが、前回、第618回でも説明したTransformerの仕組みです。
TransformerはLLMの中核技術で、Q,K,Vの三つのツールを使います。

Qは、「今、どんな過去の情報を探すか」という問いです。
Kは、過去の一手一手に付いた見出しです。
Vは、その見出しの奥に入っている中身です。

ただし、QもKもVも、実体は数字のまとまり、つまりベクトルの矢印です。
やることは、二つの矢印がどれくらい近いかの計算です。
たとえば、Qが「次の一手をどこに打つか過去から探す」とします。
そのQに近いKを探すとは、Qのベクトルの矢印の向きに近いKをさがすということです。
そして、Kを選んだら、それが持つVを取り出します。
それは、たとえばD3が60%、C4が30%、F5が10%とかです。
ここから、一番高いD3に決めたとします。
こうやって、次を予測して、もし間違えたら、ベクトルの数字、たとえばD3を50%に修正します。

こんな計算を膨大な数行うと、ある共通点が見えてきます。
たとえば、1手目、3手目、5手目には、ある共通点がありそう。
同様に、2手目、4手目、6手目にも共通点がありそうとかです。
そこで、AIは1手目、3手目、5手目の組と、2手目、4手目、6手目の組に分けて考えるようになります。
この組、何かわかりますか?

それは、自分とか相手といったプレイヤーです。

膨大なベクトル計算をしている内に、どうやら外の世界には二人のプレイヤーがいて、交互に記号を出していると理解するわけです。
もちろん、二人の人間を想像してるわけじゃなくて、二つの何か、それをAとBと呼ぶことにします。
そして、AとBが交互に記号を出していると外の世界モデルを作り上げます。
その世界モデルを使うと、次をの予測が当たりやすくなったというわけです。

ここの処理をもう少し詳しく説明します。
Qは問いですけど、問いは一つだけでなくて、いくつもあります。
そして、それぞれの問いに応じた大勢の担当者がいて、担当者がVを集めます。
この担当者のことをアテンション担当者と呼びます。
そして、担当者が集めたVは、次は編集者に渡されます。
この編集者は、専門用語でMLPと呼ばれます。

「1、3、5手目が似ている」
「2、4、6手目が似ている」
編集者は、この二つをまとめて、「どうやら二つの組が交替している」と、さらに抽象化してまとめます。
このまとめのメモをは次の階へ送られます。
オセロGPTは8階建てです。
一つの階には、8人のアテンション担当者がいます。
一つの階で資料を集め、編集者がまとめる。
次の階は、そのまとめを材料に、さらに難しい探し物をする。
これを8階で繰り返します。
1階では、近い手、遠い手、一手おきといった単純な関係。
中ほどの階では、今、ABどちらか、どの記号が関係しそうかとか。
上の階では、現在の状態なら、次にどの手が置けるか。
こんな風に、階層を少しずつ上がりながら最終的に次の手を決めます。
大事な流れはこうです。

まず、入力されたデータの関係を探ります。
つぎに、それをまとめます。
まとめを上の階に送って、上の階では、複数のまとめの関係を探します。

この繰り返しをしているうちに、どうやら、外の世界は二人のプレイヤーが交互に記号を出し合っているという世界観を作り上げるわけです。

ただ、世界はそんな単純じゃありません。
オセロAIは、新たな問題にぶつかりました。
それは、同じF3でも、いつでも次の手になれるわけではありません。
ある記号の並びの後ではF3を選べる。
別の並びの後ではF3を選べない。
なぜでしょう?

そこで、過去の手同士の関係を探し始めます。
F3とF4は、ある条件で似た働きをする。
F3とE3にも、別の共通点がある。
F3、E4、D5は、また別のまとまり方をする。


この並び、何でしょう?
そう、縦、横、斜めです。

次の手を当てるには、記号同士をこの三種類の関係でまとめるとよく当たることがわかってきたわけです。
こうして、縦、横、斜めという関係を編み出したんです。

それから、F3を一度使った後も、そのことを覚えておかないと、後の手をうまく当てられません。
F3という記号を一回見ただけでは足りません。
今のF3は空なのか、黒なのか、白なのか、この状態を覚えていないと、次を上手く予測できません。

そこで編集者は、記号の過去の履歴から、今この瞬間の状態を作り直します。
バラバラの記号だったF3、F4、E3、E4を、ある関係でつないてみます。
その関係が「位置」です。
「位置」という関係を導入することで、うまく次の手を当てられるようになりました。
どうやら、外の世界には、位置というものがあるらしいぞ。
そう推測するわけです。
そうして、何万回も繰り返すことで、どうやら外の世界は8×8の位置があるらしいと。
バラバラな記号と思われていたのは、どうやら、位置を表しているらしいと。
第619回YouTube原稿の説明図。図5 記号同士の関係が、8×8の盤面と同じ構造を作る
このAIが獲得した世界観を人間が見える形式に描きなおしたのが、8列×8行、合計64マスの盤面です。

ここが、最大のポイントです。
AIの中に、オセロの盤面や、白黒の石が描かれたわけではありません。
あるのは数字の羅列だけです。
しかし、その数字同士の関係が、オセロの盤面の関係と同じというわけです。
絵としての盤面ではなく、関係としての盤面です。

では、石が裏返ることはどうでしょう?
入力には、「ここからここまでの石が裏返りました」とは書いてありません。
書いてあるのは、置いた場所だけです。
それでも次の手を当てるには、挟まれた石の色が変わったものとして、内部の状態を更新しなければなりません。
A、B、Bと並び、その後にAが置かれたとします。
すると間のB、BがA、Aに変わったと考えないと、うまく説明がつかないことがおこります。
そこで、AIは、入力に書かれていない裏返しを内部で行うように学習します。
つまり、黒に挟まれた白は黒に裏返るというルールを自分で獲得したんです。
第619回YouTube原稿の説明図。図6 記録にない「裏返り」を、内部の状態更新として作る
ここまで来ると、AIの中には、もはや記号の列しかないとは言えません。
ある広がりがあり、広がりには位置や場所が定義される。
また、場所ごとに状態がある。
状態は出来事によって変わる。
そして、次の状態は、今の状態と出来事によって決まる。
これを、「世界」と呼んでいいのではないでしょうか。

では、時間はどうでしょう?
一枚の盤面だけなら、そこにあるのは空間です。
しかしオセロGPTには、一手目、二手目、三手目という順番があります。
GPTは未来の手を先に見ることができません。
過去の手だけを見て、次を予測します。
一手入るたびに、内部の盤面が更新されます。
状態0が、出来事によって状態1になり、さらに状態2になる。
今の盤面に、次の一手を打つことで、次の盤面は作れます。
でも、何をしても過去の盤面に戻ることはできません。
第619回YouTube原稿の説明図。図7 一枚の盤面が空間なら、盤面が順に変わる構造は時間の原型
オセロGPTは、このことを理解しています。
これは、過去には戻れない時間の流れを理解しているといってもいいのではないでしょうか。

さて、人間の話に戻ります。
脳に入るのも、記号の列と同じです。
網膜から送られてくるのは赤、青、明るい、暗いという、膨大な信号です。
右目と左目では少し違う。
頭を動かすと並び方が変わる。
手を伸ばすと、ある場所で触覚が返ってくる。
最初は全部、バラバラです。
でも脳が、その中に繰り返し現れる関係を見つけます。
頭を右に動かすと、視界の点々は左へ流れる。
近づくと、その点々のかたまりは大きくなる。
手で触ると、いつも同じところで硬い感触が返ってくる。
この無数の関係を、脳内の担当者が集め、編集者がまとめる。
すると、「毎回バラバラの点が出ている」と考えるより、「そこに机があり、自分の見える角度だけが変わっている」と考えた方が、次を予測しやすくなります。
机という物体が生まれます。
机が置かれている場所が生まれます。
自分と机の距離が生まれます。
そして、それら全部を包む空間が生まれます。
第619回YouTube原稿の説明図。図8 感覚信号から、脳内に「意識の仮想世界」が組み上がる

ここで、生物の進化について考えてみます。
生物は次に何が起こるかを予測しなければなりません。
木の陰に消えた獲物が、どこから出てくるか。
崖の向こうに地面が続いているか。
高精度に予測できないと生存できません。
そうやって、次に何が起こるか高精度に予測するように脳が進化するとします。
進化して獲得した脳は大脳です。
大脳が、次を予測するニューラルネットワーク、LLMで動いているとします。
脳には、感覚器を通して外の世界から絶えず、膨大なデータが送られてきます。
LLMは、膨大なデータから外の世界のモデルを脳内に作ります。
このことは、オセロGPTの研究からも明らかです。
目で見た外の世界が、脳内に仮想世界として再構築されるわけです。
脳内に作られた仮想世界を介して、意識は外の世界を認識する。
これは、僕が提唱する意識の仮想世界仮説です。
10年以上前から唱えている仮説ですけど、それが、LLMから導き出された結論と同じとなりました。
これは、意識の仮想世界仮説が証明されたと言ってもいいのではないでしょうか。
意識の仮想世界仮説に興味がある方は、よかったらこちらの本を読んでください。

はい、この動画がおもしろかったら、チャンネル登録、高評価お願いしますね。
それじゃあ、次回も、おっ楽しみに!

タイトル

AI世界が存在すると思っていた。

参考論文

Kenneth Liほか「Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task」ICLR 2023(最新版v5、2024年6月)

論文ページ(arXiv)

ロボマインド・プロジェクト、第619弾!

こんにちは、ロボマインドの田方です。

あなたは、今、自分は部屋の中にいるとか、目の前に世界があると思っていますよね。

だって、目の前に部屋とか世界が見えますから。

でも、見えるからと言って、本当に世界が存在するとは言えません。

たとえばライントレーサーで考えてみます。

ライントレーサーは、白い床に描かれた黒い線に沿って走るロボットです。

左右に、目の代わりになるセンサーが付いていて、センサーでラインを感じ取って走ります。

ライントレーサーが走る様子を見たら、こう思うかもしれません。

「このロボットは、世界とは白い床と、そこに描かれた黒い道だ。

自分は、今、黒い道に沿って走っている」

でも、ちょっと考えたらそうじゃないことがわかります。

ライントレーサーがやっているのは、左のセンサーが黒を感じたら、少し左へ。

右のセンサーが黒を感じたら、少し右へ。

これだけです。

床があるとか、世界があるとかなんて考えたこともありません。

あるのは、センサーから送られてくるデータと、そのでータに応答してモーターを回す命令だけです。

そう考えると、目があるから世界があると認識できるわけじゃないってことがわかりますよね。

だって、網膜から送られてくるのは赤とか青のただの色データだけですから。

じゃぁ、どうやったら外の世界は3次元空間だとか、空間の中に自分がいるって思えるんでしょう。

考えたら不思議です。

ここで、ちょっとおもしろい論文を紹介します。

それは、ハーバード大学の研究チームが発表したオセロGPTという論文です。

オセロって、8×8のマス目に白と黒の石を順番に置くゲームですよね。

横をA~H、縦を1~8とすれば、マスの位置は「E3」とかって記号で定義できます。

すると、ゲームの進行は、E3、F5とかって石を置いて行った順番で表せますよね。

研究では、この記号の並びだけをAIに学習させました。

ただし、学習させたのは、2000万局もの膨大なデータです。

そしたら、内部のニューラルネットワークに8×8マスが作られていることが確認できたんです。

これ、考えたらすごいことです。

だって、AIは、この記号の並びがオセロの手を示しているとか教えられていないんですよ。

それどころか、マス目があるとか、そこに石を順番に置くといった超基本的なルールすら教えていません。

それなのに、8×8のマス目があるって理解したんです。

つまり、外から入力される記号の並びだけで、この世界は、8×8のマス目でできているって理解したんです。

それだけじゃないですよ。

マス目に自分と相手が交互に石を置くとか、自分の石で相手の石を挟むと、相手の石は自分の石になるってルールまで理解したんですよ。

すごいですよね。

しかも、これ、人間にも当てはまりますよね。

僕らは、この世に生まれたとき、この世界は三次元の空間だってことを知りません。

ただ、網膜から脳にデータが送られてくるだけです。

網膜から送られてくるデータは位置と色を表す一種の記号です。

脳は、それが位置を表すのか、色を表すのかすら知りません。

ただ、何らかの情報処理をすることで、この世界は3次元の空間だと理解するわけです。

ただ、自然に行っているから、目を開けるだけで、目の前に部屋がある、世界があると思うわけです。

世界があると思える情報処理、その仕組みを知るには、AIに聞くのが一番早いです。

これが今回のテーマです。

AI世界が存在すると思っていた。

それでは、始めましょう!

さて、オセロGPTはLLMでできています。

つまり、大量の文書を読むことが得意です。

ただ、今回読ませたのは文章でなくて、オセロゲームの手です。

つまり、石が置かれた位置とその順番だけです。

たとえば、E3、F5、D6、C4……といった文字列です。

AIは、世界は8×8のマス目でできているとか、ゲームをしているなんてことは知りません。

AIの中で起こっていることをたとえると、窓から次々にデータが送り込まれる真っ暗な部屋です。

その中で、データを分析することで、外の世界がどうなっているのか予測するんです。

ただし、外の世界を予測せよと指示されたわけじゃありません。

指示されたのは、入力されたデータから、次に来るデータを予測せよです。

ただ、次のデータを高精度に予測するためには、外の世界がどうなっているのかわからないといけませんよね。

そこで、AIの中に外の世界のモデルが自然とできたんです。

たとえば、入力されたデータがオセロのデータなら、AIのなかにオセロのモデルが自然と浮かび上がるんです。

これだけじゃよくわからないとおもうので、AIの内部でどんな計算をしているのか詳しく解説します。

実際の中身は数式だらけですけど、今回は数式は一切使わず、小学生でもわかるように解説するので安心してください。

さて、AIの中には、E3とかって記号が入力されました。

最初、このE3という記号には何の意味もありません。

「Eは横、3は縦」なんてことも知りません。

まず、E3は、意味のない512個の数字の並びに変換されます。

これを512次元のベクトルと呼びます。

最初は、ほとんどデタラメな数字です。

ところが2000万局ものデータを使って、次の手を何度も何度も予測させます。

予測を外したら数字を少し直します。

また外したら、また少し直します。

これを途方もない回数、繰り返します。

すると、ただの数字に、少しずつ役割が生まれてきます。

ここで働くのが、前回、第618回でも説明したTransformerの仕組みです。

TransformerはLLMの中核技術で、Q,K,Vの三つのツールを使います。

Qは、「今、どんな過去の情報を探すか」という問いです。

Kは、過去の一手一手に付いた見出しです。

Vは、その見出しの奥に入っている中身です。

ただし、QもKもVも、実体は数字のまとまり、つまりベクトルの矢印です。

やることは、二つの矢印がどれくらい近いかの計算です。

たとえば、Qが「次の一手をどこに打つか過去から探す」とします。

そのQに近いKを探すとは、Qのベクトルの矢印の向きに近いKをさがすということです。

そして、Kを選んだら、それが持つVを取り出します。

それは、たとえばD3が60%、C4が30%、F5が10%とかです。

ここから、一番高いD3に決めたとします。

こうやって、次を予測して、もし間違えたら、ベクトルの数字、たとえばD3を50%に修正します。

こんな計算を膨大な数行うと、ある共通点が見えてきます。

たとえば、1手目、3手目、5手目には、ある共通点がありそう。

同様に、2手目、4手目、6手目にも共通点がありそうとかです。

そこで、AIは1手目、3手目、5手目の組と、2手目、4手目、6手目の組に分けて考えるようになります。

この組、何かわかりますか?

それは、自分とか相手といったプレイヤーです。

膨大なベクトル計算をしている内に、どうやら外の世界には二人のプレイヤーがいて、交互に記号を出していると理解するわけです。

もちろん、二人の人間を想像してるわけじゃなくて、二つの何か、それをAとBと呼ぶことにします。

そして、AとBが交互に記号を出していると外の世界モデルを作り上げます。

その世界モデルを使うと、次をの予測が当たりやすくなったというわけです。

ここの処理をもう少し詳しく説明します。

Qは問いですけど、問いは一つだけでなくて、いくつもあります。

そして、それぞれの問いに応じた大勢の担当者がいて、担当者がVを集めます。

この担当者のことをアテンション担当者と呼びます。

そして、担当者が集めたVは、次は編集者に渡されます。

この編集者は、専門用語でMLPと呼ばれます。

「1、3、5手目が似ている」

「2、4、6手目が似ている」

編集者は、この二つをまとめて、「どうやら二つの組が交替している」と、さらに抽象化してまとめます。

このまとめのメモをは次の階へ送られます。

オセロGPTは8階建てです。

一つの階には、8人のアテンション担当者がいます。

一つの階で資料を集め、編集者がまとめる。

次の階は、そのまとめを材料に、さらに難しい探し物をする。

これを8階で繰り返します。

1階では、近い手、遠い手、一手おきといった単純な関係。

中ほどの階では、今、ABどちらか、どの記号が関係しそうかとか。

上の階では、現在の状態なら、次にどの手が置けるか。

こんな風に、階層を少しずつ上がりながら最終的に次の手を決めます。

大事な流れはこうです。

まず、入力されたデータの関係を探ります。

つぎに、それをまとめます。

まとめを上の階に送って、上の階では、複数のまとめの関係を探します。

この繰り返しをしているうちに、どうやら、外の世界は二人のプレイヤーが交互に記号を出し合っているという世界観を作り上げるわけです。

ただ、世界はそんな単純じゃありません。

オセロAIは、新たな問題にぶつかりました。

それは、同じF3でも、いつでも次の手になれるわけではありません。

ある記号の並びの後ではF3を選べる。

別の並びの後ではF3を選べない。

なぜでしょう?

そこで、過去の手同士の関係を探し始めます。

F3とF4は、ある条件で似た働きをする。

F3とE3にも、別の共通点がある。

F3、E4、D5は、また別のまとまり方をする。

この並び、何でしょう?

そう、縦、横、斜めです。

次の手を当てるには、記号同士をこの三種類の関係でまとめるとよく当たることがわかってきたわけです。

こうして、縦、横、斜めという関係を編み出したんです。

それから、F3を一度使った後も、そのことを覚えておかないと、後の手をうまく当てられません。

F3という記号を一回見ただけでは足りません。

今のF3は空なのか、黒なのか、白なのか、この状態を覚えていないと、次を上手く予測できません。

そこで編集者は、記号の過去の履歴から、今この瞬間の状態を作り直します。

バラバラの記号だったF3、F4、E3、E4を、ある関係でつないてみます。

その関係が「位置」です。

「位置」という関係を導入することで、うまく次の手を当てられるようになりました。

どうやら、外の世界には、位置というものがあるらしいぞ。

そう推測するわけです。

そうして、何万回も繰り返すことで、どうやら外の世界は8×8の位置があるらしいと。

バラバラな記号と思われていたのは、どうやら、位置を表しているらしいと。

このAIが獲得した世界観を人間が見える形式に描きなおしたのが、8列×8行、合計64マスの盤面です。

ここが、最大のポイントです。

AIの中に、オセロの盤面や、白黒の石が描かれたわけではありません。

あるのは数字の羅列だけです。

しかし、その数字同士の関係が、オセロの盤面の関係と同じというわけです。

絵としての盤面ではなく、関係としての盤面です。

では、石が裏返ることはどうでしょう?

入力には、「ここからここまでの石が裏返りました」とは書いてありません。

書いてあるのは、置いた場所だけです。

それでも次の手を当てるには、挟まれた石の色が変わったものとして、内部の状態を更新しなければなりません。

A、B、Bと並び、その後にAが置かれたとします。

すると間のB、BがA、Aに変わったと考えないと、うまく説明がつかないことがおこります。

そこで、AIは、入力に書かれていない裏返しを内部で行うように学習します。

つまり、黒に挟まれた白は黒に裏返るというルールを自分で獲得したんです。

ここまで来ると、AIの中には、もはや記号の列しかないとは言えません。

ある広がりがあり、広がりには位置や場所が定義される。

また、場所ごとに状態がある。

状態は出来事によって変わる。

そして、次の状態は、今の状態と出来事によって決まる。

これを、「世界」と呼んでいいのではないでしょうか。

では、時間はどうでしょう?

一枚の盤面だけなら、そこにあるのは空間です。

しかしオセロGPTには、一手目、二手目、三手目という順番があります。

GPTは未来の手を先に見ることができません。

過去の手だけを見て、次を予測します。

一手入るたびに、内部の盤面が更新されます。

状態0が、出来事によって状態1になり、さらに状態2になる。

今の盤面に、次の一手を打つことで、次の盤面は作れます。

でも、何をしても過去の盤面に戻ることはできません。

オセロGPTは、このことを理解しています。

これは、過去には戻れない時間の流れを理解しているといってもいいのではないでしょうか。

さて、人間の話に戻ります。

脳に入るのも、記号の列と同じです。

網膜から送られてくるのは赤、青、明るい、暗いという、膨大な信号です。

右目と左目では少し違う。

頭を動かすと並び方が変わる。

手を伸ばすと、ある場所で触覚が返ってくる。

最初は全部、バラバラです。

でも脳が、その中に繰り返し現れる関係を見つけます。

頭を右に動かすと、視界の点々は左へ流れる。

近づくと、その点々のかたまりは大きくなる。

手で触ると、いつも同じところで硬い感触が返ってくる。

この無数の関係を、脳内の担当者が集め、編集者がまとめる。

すると、「毎回バラバラの点が出ている」と考えるより、「そこに机があり、自分の見える角度だけが変わっている」と考えた方が、次を予測しやすくなります。

机という物体が生まれます。

机が置かれている場所が生まれます。

自分と机の距離が生まれます。

そして、それら全部を包む空間が生まれます。

ここで、生物の進化について考えてみます。

生物は次に何が起こるかを予測しなければなりません。

木の陰に消えた獲物が、どこから出てくるか。

崖の向こうに地面が続いているか。

高精度に予測できないと生存できません。

そうやって、次に何が起こるか高精度に予測するように脳が進化するとします。

進化して獲得した脳は大脳です。

大脳が、次を予測するニューラルネットワーク、LLMで動いているとします。

脳には、感覚器を通して外の世界から絶えず、膨大なデータが送られてきます。

LLMは、膨大なデータから外の世界のモデルを脳内に作ります。

このことは、オセロGPTの研究からも明らかです。

目で見た外の世界が、脳内に仮想世界として再構築されるわけです。

脳内に作られた仮想世界を介して、意識は外の世界を認識する。

これは、僕が提唱する意識の仮想世界仮説です。

10年以上前から唱えている仮説ですけど、それが、LLMから導き出された結論と同じとなりました。

これは、意識の仮想世界仮説が証明されたと言ってもいいのではないでしょうか。

意識の仮想世界仮説に興味がある方は、よかったらこちらの本を読んでください。

はい、この動画がおもしろかったら、チャンネル登録、高評価お願いしますね。

それじゃあ、次回も、おっ楽しみに!