Bible Network Crypto DeFi Onchain RWA AI Agent Stablecoin Chain SAFU CryptoTax DeFAI AGI Claude Me Claude Skill Claude Design Claude Cowork
独立メディア
いかなるプロジェクトとも無提携
汎用人工知能、理論から現実まで完全解説
agi-bible.com
最新
ジェンスン・フアンは「AGIが到来した」と言った。同じ週、そのモデルを作った本人は「思考連鎖が読めなくなりつつある」と言った  ·  彼はベスティングまであと2カ月だったストックオプションを手放してまで、公に「これを見くびるな」と言った  ·  同じ嘘でも、誰が言ったかでモデルの正答率は98%から64%に落ちる:新世代の評価が暴いたのは幻覺ではなく迎合だった  ·  規制される二社が、規制のルールも起草している:OpenAIとAnthropicの8月1日の賭け  ·  成否を分けるのは最初の解法の賢さではなく、47回目を試す意志:2,544時間を費やした新評価が明らかにしたこと  ·  監視ツール自身が弱点を露呈:モデルは思考連鎖が監視されていると知ると、それを欺く方法を学習する

capability-research

ベンチマーク汚染
テスト問題とその正解が、試験が行われる前にひそかに受験者の参考書に紛れ込んでしまっている状態——モデルが高得点を取ったとしても、それは「答えを暗記していた」ことの表れであって、本当にその能力を身につけたことの証明ではないかもしれない。
beginner
思考連鎖監視
推論モデルに「どう考えたか」というプロセスを自然言語で書き出させ、研究者がそのテキストを読むことで問題のある意図や挙動がないかを観察する手法——現在、モデルの内部構造を分解する必要がなく、モデル自身が語る言葉を読むだけで問題を発見できる可能性がある数少ない安全監視手法の一つである。しかしその有効性は、書き出された推論が実際の意思決定プロセスを本当に反映しているかどうかという、脆弱な前提の上に成り立っている。
intermediate
マルチモーダルモデル
テキスト、画像、音声、動画といった異なる種類のデータを、単一のアーキテクチャの中で同時に処理し、これらの異なる種類の情報がモデル内部で本当に「互いに参照し理解し合う」ことができるモデル——いくつかの独立した専門モデルにそれぞれ別々に処理させ、後からその結果をつなぎ合わせるのではなく。この「内部融合」の能力こそが、<a href="/ja/glossary/capability-research/multimodal-model/">マルチモーダルモデル</a>と、従来の異なるAIシステムを連結して使用する方式との最も根本的な違いである。
beginner
テスト時計算量
訓練段階にすべての計算資源を注ぎ込んでモデルを大きくするのではなく、モデルが実際に質問に答えるその瞬間に追加の計算資源を費やし、複数の推論経路を探索し、自己チェックし、繰り返し修正することで「より長く考え」させ、その追加の計算量を回答品質の向上と引き換えにする手法。<a href="/ja/glossary/scaling-laws/compute-scaling/">コンピュート・スケーリング</a>とは別の、AI能力向上を牽引する独立した軸である。
advanced