研究者のDavide Pifferはある評論記事の中で、AIの数学的パフォーマンスの向上について、より妥当な説明は推論能力の深化ではなく、コンテキストウィンドウが提供するほぼ無限の記号的作業記憶にあると提唱した。Pifferは、物理学者のWignerがフォン・ノイマンとアインシュタインについて述べた観察を引用し、現在のAIを「機械によって拡張されたフォン・ノイマン」と位置づけている。AIは速度が速く、記憶力に優れている一方で、問題そのものを再構成できるアインシュタイン的な深さには、まだ到達していないという。
人間の作業記憶の数学的限界:4つの心理学研究による独立した定量的発見
Pifferは複数の心理学研究を引用し、作業記憶が数学的パフォーマンスを説明する力は、知能指数とは独立していることを示している:
Alloway & Passolunghi(2011):作業記憶は数学の成績に独立した寄与を及ぼし、一般知能の要因に左右されない
Alloway & Alloway(2010):6年間の縦断追跡研究により、5歳時点の作業記憶の成績は、知能指数テストよりもその後の学業成績をよく予測することが示された
Blankenship(2015):研究の結論は上記の発見と一致
Friso-van den Bos(2013):研究の結論は上記の発見と一致
上記の研究によれば、知能指数が近い2人の子どもでは、作業記憶容量が大きい方が、通常は数学的パフォーマンスに優れている。Pifferはこれを、AIの数学的パフォーマンスを理解する出発点としている。人間の数学的パフォーマンスはもともと記憶のボトルネックに制約されており、AIはこの制約を取り除いたというのである。
拡張型の記号的作業記憶としてのコンテキストウィンドウ
PifferはAIのコンテキストウィンドウを、言語モデルが処理できるすべてのテキストを保持する巨大な外部記号ノート、すなわち問題文、定義、中間計算、放棄された解法などをいつでも見返せるものだと表現している。
しかしPifferは、AIが書き込んだ語句はほとんど上書きできず、後ろに次々と付け加えていくことしかできないため、より正確な表現は、真の意味での人間の作業記憶ではなく「拡張型の記号的作業記憶」だと指摘している。人間の作業記憶には、注意の調整、干渉の抑制、継続的な更新という3つの機能が含まれるが、言語モデルのコンテキストは比較的受動的である。
Pifferは、この優位性が数学の分野で特に顕著になる理由として、数学はほとんど曖昧さのない記号として記述できることを挙げている。仮定、定義、既知の条件、すでに除外されたケースをすべて正確に保持でき、文脈が変わっても意味が変化しない。AIは各ステップで完全な前提を改めて確認できるため、人間の推論で条件を記憶し忘れ、うっかりゼロで割ってしまう問題を避けられる。Pifferは同時に、数学の答えはプログラムによる計算や形式証明器(各推論ステップが論理規則に従っているかを自動的に検証できるソフトウェア)によってクロスチェックできるため、外部記憶の誤りを直ちに訂正でき、誤りが連鎖的に蓄積するのを防げることにも言及している。
作業記憶の枠組みが機能しない条件:不確実な因果問題における記憶の上限
Pifferは、作業記憶の優位性が適用できる範囲を明確に指摘している。「なぜある人は突然メッセージを返さなくなったのか」を例にすると、相手が怒っている、忙しい、携帯電話が壊れている、あるいは別のことを避けているなど、原因はさまざまであり、重要な情報が最初から記録されていなければ、どれほど大きなコンテキストウィンドウでも観察されていない事実を生成することはできない。
Pifferは、「公平」「成功」「有害」といった語彙の意味自体が状況に応じて変化すると指摘している。モデルは対話全体を保持できても、対話で実際に議論されている内容を誤解する可能性がある。政治分析、歴史解釈、ビジネス上の判断が難しいのは、記憶容量が不足しているからではなく、証拠が不完全な状況で正しい因果的説明を見つけなければならないからであり、これはコンテキストウィンドウだけでは提供できない能力である。
Pifferの検証可能な予測:AIの優位性は問題の種類によって変化するはず
Pifferは、実測によって検証できる予測を1つ提示している。AIの優位性は、条件の数が多く、計算ステップが長く、複数のケースに分けて検討する必要がある問題で最も顕著になるはずである。一度の概念的飛躍だけを必要とする問題に置き換えれば、優位性は大幅に縮小するはずだ。反対方向から検証する条件としては、利用可能なコンテキストウィンドウを縮小するか、言語モデルが中間ステップを書き出すことを禁止した場合が考えられる。Pifferの予測によれば、その場合、長文の数学問題におけるパフォーマンスは不釣り合いなほど大幅に低下することになる。
フォン・ノイマンとアインシュタインの比較:Wignerの観察と現在のAIの能力の位置づけ
Pifferは、物理学者Wignerの観察を結論の枠組みとして引用している。Wignerはフォン・ノイマン(John von Neumann)とアインシュタインの両者を知っていた。フォン・ノイマンの頭脳は、彼が出会った中で最も速く、最も鋭いものであり、大量の情報を瞬時に吸収し、分野をまたいで推論することができた。一方、アインシュタインの理解はより深く、より独創的であり、問題そのものを再構成できるタイプの思考者だった。
Pifferはこの対比を基礎として、現在のAIを「機械によって拡張されたフォン・ノイマン」と位置づけている。AIは速度が速く、記憶力に優れている一方で、既存の枠組みを覆すことのできるアインシュタイン的な深さは、まだ示していない。
よくある質問
Pifferはなぜ、推論の進化よりもコンテキストウィンドウの方がAIの数学的進歩をよく説明できると考えているのか?
Pifferの主張は心理学研究に基づいている。作業記憶は、知能指数とは独立して数学的パフォーマンスを予測する効果を持ち、人間の数学的パフォーマンスはもともと記憶のボトルネックに制約されている。AIのコンテキストウィンドウはこの制約を取り除き、ほぼ無限の記号的作業空間を提供するため、推論能力そのものが変化する必要はない。
なぜコンテキストウィンドウの優位性は曖昧な問題では機能しないのか?
Pifferの分析によれば、不確実な問題(例えば政治的判断や歴史解釈)の核心的な困難は、記憶容量ではなく因果的説明にある。重要な情報が最初から完全には記録されていなければ、どれほど大きなコンテキストウィンドウでも観察されていない事実を生成することはできない。語彙の意味が状況に応じて変化することも、記憶容量を拡張するだけでは解決できない。
Pifferは現在のAIと、より深い認知能力をどのように具体的に区別しているのか?
Pifferは、Wignerによるフォン・ノイマン(速度が速く、分野をまたいだ情報吸収能力に優れる)とアインシュタイン(問題そのものを再構成でき、深い独創性を持つ)の区別を採用している。そして現在のAIは、「機械によって拡張されたフォン・ノイマン」という説明に当てはまるが、既存の枠組みを覆す必要がある問題では、アインシュタイン的な深い独創的思考をまだ示していないと考えている。