Plus de 700 manuscrits, une vérification partielle et déjà des retraits : en maths aussi, publier n’est pas prouver.
OpenAI a publié près de 400 résultats mathématiques générés par IA, mais leur validation reste incomplète. Le volume impressionne; il ne fait pas office de certificat de justesse.
La collection représente plus de 700 manuscrits et couvre plusieurs disciplines. Pour les chercheurs qui doivent en apprécier la portée, le chantier ne consiste donc pas simplement à parcourir quelques démonstrations : il faut examiner un ensemble massif, dont certains textes sont jugés difficiles à suivre. La quantité de travaux rend l’annonce spectaculaire, pas leur évaluation plus facile.
Des mathématiciens ayant examiné la collection y voient des travaux potentiellement importants. Leur appréciation s’accompagne d’une réserve nette : il est trop tôt pour porter un jugement solide sur l’ensemble. On peut donc prendre cette publication au sérieux sans lui attribuer, en bloc, la valeur de résultats déjà validés.
Le vrai sujet n’est pas le nombre de pages produites, mais ce qui a effectivement été vérifié.
42 % : le compte n’y est pas encore
OpenAI indique que 300 des 719 résultats principaux ont été formalisés, soit environ 42 %. Ce décompte concerne les résultats principaux, et non le nombre de manuscrits ou les près de 400 résultats annoncés pour la collection. Ces chiffres décrivent des périmètres différents : les mettre dans le même panier brouillerait précisément ce qu’on cherche à mesurer.
La formalisation permet une vérification informatique. C’est une étape utile, mais elle ne dispense pas d’examiner si ce qui a été formalisé correspond bien aux affirmations du manuscrit. Autrement dit, la vérification informatique et la lecture mathématique ne répondent pas exactement à la même question.
Le point mérite qu’on s’y arrête. Un contrôle informatique ne suffit pas à solder l’évaluation si la correspondance entre la formulation vérifiée et le résultat revendiqué reste à examiner. Le chiffre de 42 % ne désigne donc pas une proportion de travaux dont toute la validation serait terminée. Le tampon automatique a ses limites.
Un signe de travers, trois articles dehors
Les réserves ne sont pas seulement théoriques. Au 8 octobre, le registre de la collection mentionnait des corrections concernant plus d’une douzaine de manuscrits. Trois articles avaient également été retirés après la découverte d’une erreur de signe invalidant un argument.
Ces retraits montrent qu’une erreur peut atteindre le raisonnement lui-même, et pas uniquement sa présentation. Ils ne permettent pas de déclarer toute la collection fautive, pas davantage que les travaux jugés prometteurs ne permettent de valider tous les autres. L’évaluation doit rester à l’échelle des démonstrations, pas de l’annonce.
La machine écrit, les chercheurs démêlent
La difficulté de lecture signalée par des mathématiciens ajoute un obstacle à ce travail. Comprendre un texte, contrôler son argument et apprécier l’importance du résultat sont des tâches distinctes; l’abondance de manuscrits ne les fait pas disparaître. C’est là que se situe la limite concrète de cette publication massive : produire et rendre public ne clôt pas le travail scientifique.
Les premiers jugements associent donc intérêt et prudence. Des travaux potentiellement importants figurent dans la collection, mais les chercheurs qui l’ont examinée estiment encore prématurée une évaluation solide de l’ensemble.

Commentaires
Aucun commentaire pour le moment.