OpenAI自身の内部定義さえ財務上の閾値であるなら、それは憲章にある「人間の経済的価値を上回る」という定義が単なる建前に過ぎなかったことを意味するのでしょうか?
完全にそうとは言えない。実際にはこの2つは同じ定義の論理を、異なる精度で表現したものである。憲章にある「ほとんどの経済的価値のある仕事において人間を上回る、高度に自律的なシステム」という文言自体が、すでに経済的産出を中心とした定義であり、ただ具体的な数値の閾値がないだけである。マイクロソフトとの間の1000億ドルの利益条項は、ある意味で、この抽象的な「経済的価値を上回る」という概念を、両者が契約内で具体的に執行でき、解釈の余地のない定量化された指標へと翻訳したものである。
これはまた、より深い問題も明らかにしている。どんな抽象的なAGIの定義であっても、それが具体的で執行可能な契約や政策に落とし込まれる必要が生じた瞬間、何らかの測定可能な具体的指標へと変換されなければならず、この変換プロセス自体が、元の定義には存在しなかった新たな仮定を持ち込むことになる(例えば、「利益をもって経済的価値を代表させる」というのは、それ自体すでに一種の単純化であり、利益以外の多くの経済的影響の現れ方を見落としている)。
デミス・ハサビス氏とマーク・アンドリーセン氏がAGIの到来についてまったく正反対の判断を示していますが、どちらがより信頼できるか判断する方法はあるのでしょうか?
「どちらがより信頼できるか」を問うよりも、「それぞれが何を前提としている基準か」を問う方がより実践的かもしれない。フロンティアAI研究に長年携わってきた科学者であるハサビス氏の「まだほど遠い」という発言の背後にある基準は、おそらく学術的な定義が重視する多様性、汎化能力、データ効率といった技術的指標により近いだろう。長年AI業界への投資の可能性を有望視してきたベンチャーキャピタリストであるアンドリーセン氏の「すでに到来している」という発言の背後にある基準は、おそらく現在のAIシステムが具体的な商業応用シナリオにおいてすでに示している、莫大な経済的価値を生み出すのに十分な実用的能力により近いだろう。
どちらの判断も、それぞれが前提とする基準の下では、内部的に一貫性があり筋の通った結論である可能性がある。本当の意見の相違は、どちらかが証拠を誤って判断したことではなく、両者が最初から異なる物差しで同じ現象を測っていたことにある。これこそが、この種の真っ向から対立する公の発言を目にしたとき、急いでどちらかの側を選ぶよりも、まず双方がそれぞれ何を前提としている基準なのかを明らかにする価値がある理由である。
OpenAIのo3があるベンチマークで87%という高得点を獲得したのに、なぜそれがAGIに向けた進歩の証拠と言えるかどうかを疑問視する人がいるのですか?
この疑問の核心は、「高得点を獲得したこと」と「どのように高得点を獲得したか」が別の問題であるという点にある。論評によれば、o3のこのスコアは膨大なテスト時計算量を投入して達成された——つまり、モデルは各問題に回答する際、通常の状況をはるかに超える計算資源を投入して繰り返し推論・検証を行ったということである。ベンチマークの設計者が本来測定しようとしていたのは、通常、モデルが比較的効率的な方法で新しい問題に汎化できるかどうかであり、「十分な計算量を投入する意志さえあれば、ほぼどんな十分に高性能なモデルでも特定のテストで高得点を獲得できる」という能力ではない。
これこそが、テスト時計算量という概念を理解することが、「あるモデルがあるベンチマークで新記録を樹立した」といったニュースをより正確に解釈する助けとなる理由でもある。問題はスコアそのものだけでなく、そのスコアがどのような計算コストと引き換えに得られたかにもある——もし答えが「通常の状況では用いられないような莫大な計算資源を投入した」というものであれば、そのスコアが直接「AGIに近づいた」ことと同一視できるかどうかは、それ自体さらなる精査が必要な問題である。
専門家でさえAGIの定義について合意に至れないなら、一般の読者は「これはAGIに該当するのか」という問題をあまり気にしなくてもいいのではないでしょうか?
気にしなくていいというより、注目すべき焦点を調整する必要があると言った方が適切かもしれない。「このシステムは本当にAGIに該当するのか」という二元的な判断にエネルギーを費やすよりも(結局のところ定義自体に合意がないのだから、この問いは永遠に誰もが同意する答えを得られない可能性が高い)、より実践的なアプローチは、具体的で観察可能な能力の変化そのものに焦点を当てることである。例えば、あるモデルが特定のタスクの種類でどれだけ性能が向上したか、その向上がアルゴリズムの革新によるものか計算量の積み増しによるものか、その向上が実世界の応用シナリオで安定して再現できるかどうかといった点である。
これこそが、本サイトのコンテンツ設計が、「AGIはあと数年で到来する」といった断定を直接下すのではなく、ARC-AGIベンチマークのスコアの変化、テスト時計算量が性能にどう影響するか、思考連鎖監視がモデルの推論プロセスを本当に検証できるかといった、具体的で検証可能な技術的進展により重点を置いている理由である。後者のような判断は結局のところ、現時点でまだ合意のない定義の上に成り立っており、確実に見える答えであっても、まず「これはどの定義の下で成立しているのか」と一度問う価値がある。
AGI関連のニュースを追い始めようとしているなら、最初に知っておくべきことは、少し直感に反するかもしれない。現時点で、誰もが同意する単一の「AGI」の定義は存在しないのである。これは無害な用語上の些細な違いに聞こえるかもしれないが、実際には、この定義上の意見の相違が、数十億ドル規模の契約の行方、企業間の訴訟の駆け引き、そして各国政府の政策の方向性に、本当に影響を与えてきた。
OpenAI憲章はAGIを「ほとんどの経済的価値のある仕事において人間を上回る、高度に自律的なシステム」と定義している——注目すべきは、この定義が完全に「経済的産出」を中心に据えており、多くの人が直感的に連想する「機械に意識があるか」「機械が自ら考えられるか」といったこととはほとんど関係がないという点である。Google DeepMindのCEOであるデミス・ハサビス氏は、私たちはAGIから「まだほど遠い」と公に述べている。一方、ベンチャーキャピタリストのマーク・アンドリーセン氏は、AGIは「すでに到来している」と述べている。両者ともこの分野で重みのある専門家だが、明らかに同時に両方とも正しいということはありえない——それはまさに、この二人がそれぞれ「AGI」と口にするとき、頭の中でまったく異なるものを想定している可能性が非常に高いからである。
この定義をめぐる争いの中で最も劇的な具体的事例は、OpenAIとマイクロソフトの間で起きた。複数のメディアの報道によれば、両社は初期の契約に「AGI条項」を盛り込んでいた。OpenAIの取締役会が自社のシステムがAGIを達成したと正式に宣言した時点で、マイクロソフトの既存の技術ライセンスは自動的に無効になるというものだった。しかし、この条項を実際に執行可能にするには、両者は具体的に判定できる基準を必要とした——The Informationの報道によれば、両社が非公式に定めた判定基準は、意識、推論能力、汎用性とはまったく関係がなく、財務上の閾値だった。OpenAIが少なくとも1000億ドルの利益を生み出すAIシステムを開発すれば、それをAGIの達成とみなすというものである。当時のOpenAIが依然として巨額の損失を出しており、黒字化は早くても2029年になると見込まれていた財務状況を考えると、この定義は事実上、AGIの到来時期がある意味で財務報告に依存し、いかなる技術評価にも依存しないことを意味していた。この条項は2026年に複数回の再交渉を経て、同年4月に両社がマイクロソフトのOpenAI技術へのライセンスを2032年まで延長すると発表し、AGI条項自体の効力もそれに応じて変化した——「AGIとは何か」をめぐるこのビジネス上の駆け引き全体が、この用語の定義が現時点でいかに不安定であるかを最もよく示している。
ビジネス契約の話は脇に置くとしても、学術・研究コミュニティもAGIの定義をめぐって同様に意見が分かれている。Google DeepMindが2023年に発表した論文は、意図的に焦点を「経済的価値」から移し、代わりに「多様性」を核心的な判断基準として用いた——例えば、システムが乏しいデータの下で新しいスキルを迅速に習得できるかどうかであり、単に特定のタスクで人間を上回るかどうかではない。一般の人々に最もよく見られる俗説的な定義は、「人間が行えるあらゆる認知タスクを、少なくとも人間レベルで実行できるシステム」というものだが、この定義も同様に曖昧である。「あらゆる認知タスク」とは具体的に何を含むのか?「人間レベル」とは一般人のレベルを指すのか、それともその分野の専門家のレベルを指すのか?これらの問いに現時点で標準的な答えはない。
この分野を追い始めたばかりの読者にとって、この定義をめぐる争いを理解することの最も実践的な意義は次の通りである。「AGIはもうすぐ到来する」あるいは「私たちはAGIからまだほど遠い」といった見出しを見るたびに、最初に問うべき問いは「この主張は正しいか」ではなく、「この発言をした人物は、頭の中でどんなAGIの定義を想定しているか」である。ある研究機関のCEO、ある学術研究者、そしてある商業契約の弁護士は、それぞれ「AGI」と口にするとき、まったく異なる3つのものを想定している可能性がある。OpenAIのo3モデルはある公開ベンチマークで約87%のスコアを獲得し、一部の人々からAGIに向けた重要な突破口とみなされたが、このスコアは膨大なテスト時計算量を投入して達成されたものであり、使用された手法はベンチマークの設計者が本来測定しようとしていた「効率的な汎化能力」を反映していない可能性があると指摘する人々もいる。これこそが、「AGI」という言葉の背後にある定義上の意見の相違を理解することが、この分野全体に足を踏み入れる上で最も基礎的で、最も必要な第一歩である理由である。それは、この後読むことになるあらゆる関連記事をどう解釈すべきかに直接影響するのである。