Jérémy Magrin
Développeur React Native Freelance Senior · Expo · iOS & Android
... ou pas
99,9% sur ARC-AGI-3, le test censé mesurer l'intelligence générale
97,6% sur le math le plus dur qui existe
100% sur ExploitBench
Dossier clos, tout le monde crie à l'AGI
Puis un dev lui a demandé un truc qu'un étudiant en 3D boucle en un aprem
Rigger et animer ce guépard qui court dans Blender, qualité AAA digne d'Hollywood
Regarde le résultat dans la vidéo, et dis-moi si c'est ça ton AGI
Le détail que personne ne lit sous le 99,9%
C'est le score obtenu avec le harnais maison d'OpenAI, plein d'outils branchés autour du modèle
Un appel API standard, celui que tu ferais toi, tombe à 62,7%
Et en stateless pur, entre 17 et 63% selon les mesures
Le plus fou c'est ARC Prize eux-mêmes qui lâchent le morceau
Saturer leur benchmark ne prouve pas l'AGI
Leurs environnements sont fermés et déterministes, ça ne ressemble à rien du monde réel
Le benchmark, c'est le contrôle de maths bachoté la veille
Le guépard dans Blender, c'est le vrai boulot du lendemain
Je m'en sers tous les jours et ça me fait gagner un temps de dingue
Mais AGI, faut arrêter deux minutes
Toi tu crois les benchmarks, ou ce que ça te sort quand tu bosses vraiment avec ?