GeneBench-Pro : OpenAI lance un benchmark si complexe que même GPT 5.6 Sol peine à le maîtriser
Dans le monde en évolution rapide de l’intelligence artificielle, GeneBench-Pro s’impose comme un véritable défi pour les modèles, même les plus avancés comme GPT-5.6 Sol. Ce benchmark ambitieux, conçu par OpenAI, mesure non seulement la capacité des agents à traiter des données biologiques complexes, mais évalue aussi leur aptitude à faire des choix analytiques critiques. Avec des exercices qui reflètent des travaux de recherche réels, ce projet soulève des questions cruciales sur le jugement scientifique des intelligences artificielles. L’heure est venue de se demander jusqu’où ces technologies peuvent vraiment raisonner et quelles implications cela pourrait avoir pour le futur de la recherche scientifique.
OpenAI vient de dévoiler GeneBench-Pro, un nouveau benchmark qui pousse l’intelligence artificielle dans ses retranchements les plus complexes. Conçu pour mesurer la capacité des modèles à naviguer dans des données biologiques chaotiques et à prendre des décisions qui ressemblent à celles d’un véritable chercheur, ce système met à l’épreuve même les meilleures IA comme GPT 5.6 Sol, qui a du mal à répondre aux défis posés par ce projet ambitieux. L’enjeu est de taille : il s’agit non seulement de comprendre des données, mais aussi de prouver un véritable jugement scientifique.
Qu’est-ce que GeneBench-Pro ?
GeneBench-Pro est une avancée majeure dans le domaine des benchmarks IA. Il réunit 129 défis axés sur la génomique, la biologie quantitative et la médecine translationnelle. Chaque tâche offre un contexte d’expérience unique accompagné d’un jeu de données et d’une question spécifique. Contrairement à d’autres tests, l’IA ne peut pas se contenter de répliquer des études préexistantes ; elle doit être capable d’explorer en profondeur les informations, de choisir la méthode d’analyse adéquate et de formuler une conclusion pertinente.
Évaluation indépendante et véracité scientifique
Avant de lancer GeneBench-Pro, OpenAI a sollicité l’évaluation d’experts indépendants pour s’assurer de la validité des scénarios proposés. Des doctorants, des chercheurs postdoctoraux, ainsi que des scientifiques de l’industrie ont passé au crible 82 des 129 problèmes. Beaucoup d’entre eux ont constaté que ces exercices pourraient poser des difficultés considérables à un doctorant sans l’assistance d’un superviseur. L’approbation des experts souligne la rigueur et le niveau d’élaboration de chaque question, posant ainsi un défi véritablement sérieux aux IA.
Les performances de GPT 5.6 Sol face à GeneBench-Pro
Bien que GPT 5.6 Sol ait fait des progrès significatifs, atteignant un score de 28,7 % dans son niveau de raisonnement le plus élevé et 31,5 % en mode Pro, il reste en deçà des attentes par rapport aux performances humaines. Pour référence, la version précédente, GPT 5, ne franchissait pas la barre des 5 % lors des premiers tests. Le travail requis pour résoudre un problème typique de GeneBench-Pro correspondrait à 20 à 40 heures d’efforts d’un spécialiste humain, entraînant des coûts considérables. En revanche, une IA peut exécuter ce travail à un coût marginal, illustrant ainsi l’énorme potentiel que certaines technologies peuvent offrir aux chercheurs.
Un avenir prometteur pour l’IA
Bien que GeneBench-Pro représente une avancée majeure, quelques modèles restent loin derrière. Par exemple, Opus 4.8 ne dépasse pas 16 %, tandis que Grok 4.3 se retrouve avec un score famélique de 1,5 %. Cela impressionne moins comparé au travail abattu par des chercheurs associés qui risquent de dépenser des milliers de dollars pour résoudre un seul exercice, alors qu’une IA le fait pour quelques dollars d’inférence.
OpenAI ouvre les portes à l’évaluation indépendante
OpenAI a pris soin de mettre à disposition une partie des questions de ce projet. Dix problèmes représentatifs sont désormais accessibles en open source sur Hugging Face, permettant ainsi à la communauté scientifique de jongler avec ces données. De plus, un ensemble de 50 autres questions sera confié à Artificial Analysis pour des évaluations indépendantes, garantissant que les modèles d’IA sont testés sous différents angles, et que leur progression continue d’évoluer.
En fin de compte, alors que GeneBench-Pro défie les limites de l’intelligence artificielle avec une complexité sans précédent, cette initiative stimule les avancées dans le domaine. L’ouverture aux tests indépendants et la publication de résultats montrent une volonté de collaboration et d’innovation essentielle pour l’avenir de l’IA.
Notez cet article