記事の感想とコメント
AIや企業によるカンニングを防ぎつつ最先端モデルをテストする方法をGoogleが考案
感想
この記事についての感想
AIの進化スピードがマジでヤバいことになってるよね。最近だとLLMの評価とかベンチマークの信頼性がガチで議論になってるけど、Googleがまたエグい手法をぶち込んできたなって感じ。ぶっちゃけ今のAI界隈って、みんなベンチマークのスコアを盛るのに必死すぎて、本当に賢いのか暗記してるだけなのか分からなくなりがちじゃん?データ汚染とかカンニングなんて日常茶飯事だし、このままじゃ評価指標自体が形骸化しちゃうよなって思ってたところに、このテスト方法の提案。これ、動的に生成したタスクを使ったりして、後出しジャンケンを封じようっていうアプローチなんだろうけど、マジで開発者泣かせというか、いたちごっこが加速しそうな予感しかしないわ。でもまあ、こうやって大手があらゆる手段を講じて「ガチの知能」を測ろうとする姿勢は嫌いじゃないね。結局のところ、人間が作ったテストをAIが解くだけなら、そりゃ学習データに答えが混入するのも時間の問題だし、今回みたいなトリッキーな手法が標準化されていくのは必然なのかも。ただ、これに対抗してAIがさらに巧妙なカンニングを始めるっていう未来も容易に想像できちゃうのが草すぎる。技術の発展とそれを監視する側の戦いは永遠に続くんだろうな。個人的にはベンチマークの数字でマウント取り合う時代が終わって、もっと実務的な、それこそ「現実世界の超絶面倒なタスクをどれだけこなせるか」みたいな評価軸がメインになってほしいんだけどね。今回のGoogleの試みがどこまで浸透するか、界隈の反応を含めて生暖かく見守っていきたい所存。
あなたの感想は?
結局AIとのいたちごっこになってて草生えるわ
ベンチマーク警察の出番がまた増えそうだね