ベンチマーク汚染
テスト問題とその正解が、試験が行われる前にひそかに受験者の参考書に紛れ込んでしまっている状態——モデルが高得点を取ったとしても、それは「答えを暗記していた」ことの表れであって、本当にその能力を身につけたことの証明ではないかもしれない。
beginner
思考連鎖監視
推論モデルに「どう考えたか」というプロセスを自然言語で書き出させ、研究者がそのテキストを読むことで問題のある意図や挙動がないかを観察する手法——現在、モデルの内部構造を分解する必要がなく、モデル自身が語る言葉を読むだけで問題を発見できる可能性がある数少ない安全監視手法の一つである。しかしその有効性は、書き出された推論が実際の意思決定プロセスを本当に反映しているかどうかという、脆弱な前提の上に成り立っている。
intermediate
マルチモーダルモデル
テキスト、画像、音声、動画といった異なる種類のデータを、単一のアーキテクチャの中で同時に処理し、これらの異なる種類の情報がモデル内部で本当に「互いに参照し理解し合う」ことができるモデル——いくつかの独立した専門モデルにそれぞれ別々に処理させ、後からその結果をつなぎ合わせるのではなく。この「内部融合」の能力こそが、<a href="/ja/glossary/capability-research/multimodal-model/">マルチモーダルモデル</a>と、従来の異なるAIシステムを連結して使用する方式との最も根本的な違いである。
beginner
テスト時計算量
訓練段階にすべての計算資源を注ぎ込んでモデルを大きくするのではなく、モデルが実際に質問に答えるその瞬間に追加の計算資源を費やし、複数の推論経路を探索し、自己チェックし、繰り返し修正することで「より長く考え」させ、その追加の計算量を回答品質の向上と引き換えにする手法。<a href="/ja/glossary/scaling-laws/compute-scaling/">コンピュート・スケーリング</a>とは別の、AI能力向上を牽引する独立した軸である。
advanced