速報 · マイルストーン
トップモデルと他のモデルを分けるのは、誰の最初の解法が賢いかではなく、46回却下されても47回目の修正を試みる意志があるかどうかだ。
Elena Voss
·
2026年09月05日
2026年6月、複数機関にまたがる研究チームが、AutoLabと呼ばれる新しい評価を発表した。これは、最先端モデルが本物の研究者のように、数時間、時には十数時間にわたって「コードを観察し、変更を提案し、実験を実行し、結果を確認し、再び修正する」というサイクルを持続できるかを専門的に測定するものだ。既存の評価の多くのように、一問一答で正解を出せるかどうかだけを見るのではない。この評価の結論は、多くの人が持つ「どのモデルが最も賢いか」という直感とは食い違っている。実際にモデル間の差を分けるのは、誰の最初の解法が最も洗練されているかではなく、46回却下された後でも47回目の修正を試みる意志があるかどうかなのだ。なぜ新しい評価が必要だったのか——既存の評価が測っているもの、測っていないもの研究チームは、既存の最先端モデル評価が大きく二つのカテゴリーに分かれると指摘する。一つはLiveCode...