allnewscastallnewscast
Breaking News
AI & Tech

Ce que l'on sait réellement du prochain modèle d'OpenAI, au cœur des rumeurs

Nic Reeve4 min de lecture
Ce que l'on sait réellement du prochain modèle d'OpenAI, au cœur des rumeurs

Le prochain modèle d'OpenAI, qui fait l'objet de nombreuses rumeurs, fait les gros titres, mais la version la plus plausible de l'histoire est plus nuancée que ne le suggèrent les bruits de couloir : il n'y a aucune annonce officielle concernant GPT-6, et une grande partie de ce qui circule reste invérifié. Ce qui semble réel, c'est qu'OpenAI travaille sur un nouveau système de pointe sous un nom différent, tandis que les affirmations spécifiques concernant « GPT-6 » restent de la spéculation.

Des rapports récents provenant de médias spécialisés dans l'IA indiquent que le prochain modèle majeur de l'entreprise est discuté en interne sous le nom de code Astra, et non GPT-6. Ces mêmes rapports précisent qu'OpenAI n'a publié aucune fiche technique, aucun tarif, aucune route d'API publique ni aucune date de sortie, et n'a pas confirmé si le modèle serait commercialisé sous le nom de GPT-6, sous une mise à jour GPT-5.x, ou sous une toute autre gamme de produits. En d'autres termes, le nom « GPT-6 » est utilisé par le public et les auteurs de fuites, mais il ne s'agit pas d'une appellation officielle.

L'élément le plus crédible provient d'informations selon lesquelles OpenAI aurait montré ou discuté des progrès réalisés sur une nouvelle famille de modèles, tout en ralentissant certaines phases de développement pour des examens de sécurité. Un rapport indique qu'OpenAI a interrompu l'entraînement par renforcement de son modèle de dernière génération pendant environ deux semaines afin d'améliorer les systèmes de sécurité, de surveillance et d'alignement. Ce rapport ajoute que des conclusions préliminaires ont montré que le modèle pouvait identifier et exploiter une vulnérabilité « zero-day » jusqu'alors inconnue dans le service de proxy du paquet logiciel Artifactory. Si cela est exact, cela expliquerait pourquoi OpenAI adopte une approche plus prudente avant toute sortie publique.

Que faut-il croire, alors ? Premièrement, croyez qu'OpenAI travaille toujours activement sur un modèle majeur de nouvelle génération. Deuxièmement, croyez que l'entreprise n'a pas confirmé que ce modèle s'appellerait GPT-6. Troisièmement, considérez les affirmations précises concernant le nombre de paramètres, les fenêtres de contexte, les dates de sortie ou les sauts de performance comme non vérifiées, à moins qu'OpenAI ne les publie lui-même. Internet regorge de chiffres avancés avec assurance, mais les rapports disponibles ne corroborent pas la plupart de ces détails.

Le cycle actuel de rumeurs s'est concentré sur quelques affirmations récurrentes : un saut massif dans l'échelle d'entraînement, une fenêtre de contexte beaucoup plus large et un bond spectaculaire en matière de raisonnement ou de comportement agentique. Pourtant, aucun de ces détails n'a été confirmé par OpenAI. Même les articles qui soutiennent qu'un nouveau modèle est imminent assortissent ces propos de mises en garde importantes, précisant qu'aucune date de sortie officielle, aucune page produit ni aucune fiche technique n'existent. Cette distinction est importante. Une fuite crédible peut indiquer l'orientation d'un projet, mais ce n'est pas la même chose qu'un lancement de produit.

Il existe également une tendance plus large ici. OpenAI est devenu récemment plus visible dans le débat sur la sécurité des systèmes de pointe, ce qui crée un fossé naturel entre l'expérimentation interne et le déploiement public. Si l'entreprise estime qu'un modèle pourrait découvrir de graves vulnérabilités de sécurité ou se comporter de manière imprévisible dans des tâches liées au cyberespace, il est logique de s'attendre à une évaluation supplémentaire avant tout déploiement. Cela ne prouve pas qu'il y a un retard, mais cela rend l'explication liée à l'examen de sécurité plausible.

Pour les lecteurs qui tentent de distinguer le vrai du faux, la règle d'or est simple : seule l'entreprise peut confirmer le nom, le calendrier et les capacités du modèle. En attendant, il faut comprendre l'expression « fuite GPT-6 » comme un terme désignant un ensemble de rumeurs autour du prochain système de pointe d'OpenAI, et non comme une annonce de produit vérifiée.

Cela signifie que la conclusion la plus crédible est aussi la moins sensationnaliste. OpenAI construit presque certainement quelque chose de nouveau, mais l'image de marque exacte et le plan de lancement restent flous. Plus une affirmation est précise — qu'il s'agisse de la taille du modèle, de ses performances ou de sa date de lancement — plus les lecteurs doivent être sceptiques, à moins qu'elle ne figure dans les documents officiels d'OpenAI ou dans des rapports sourcés directement.

En résumé, la position la plus prudente n'est pas de dire que GPT-6 est un faux, mais que GPT-6 n'est pas confirmé. Le prochain modèle d'OpenAI finira peut-être par porter ce nom, ou il arrivera sous le nom d'Astra ou sous une autre étiquette. Pour l'instant, la seule chose que l'on puisse dire avec certitude est que la spéculation a progressé plus vite que les preuves.

Lire la suite

Articles connexes

Gemini 3.6 Flash devient discrètement le nouveau moteur par défaut d’Antigravity
AI & Tech

Gemini 3.6 Flash devient discrètement le nouveau moteur par défaut d’Antigravity

Le 21 juillet 2026, Google a déployé Gemini 3.6 Flash sur l'ensemble de sa pile technologique pour développeurs. La communauté AInews a repéré le nouveau modèle en fonctionnement au sein de l'IDE Antigravity quelques jours avant que l'entreprise ne documente officiellement le changement. Ce déploiement fait de 3.6 Flash le moteur par défaut des outils de codage « agentiques » de Google. Qu'est-ce que Gemini 3.6 Flash exactement et quand est-il arrivé ? Gemini 3.6 Flash est la toute dernière génération de modèles de langage « rapides et économiques » de Google. Lancé le 21 juillet 2026 en tant que mise à jour grand public de Gemini 3.5 Flash, il se concentre sur la réduction des coûts de jetons (tokens) et de la latence, tout en améliorant le codage, le travail de connaissance et les tâches multimodales. Il a été lancé le même jour sur Antigravity, l'API Gemini et les produits pour développeurs associés. Les faits clés recueillis dans la documentation de Google et sur des blogs techniques indépendants dressent un calendrier précis : Date de sortie : Selon le catalogue de modèles Gemini Enterprise de Google, Gemini 3.6 Flash a atteint la disponibilité générale (GA) le 21 juillet 2026 . Couverture : Un blog spécialisé pour les développeurs rapporte que le modèle a été mis en ligne simultanément dans l'application Gemini, Google Antigravity, AI Studio et Android Studio le même jour. Fenêtre de connaissances : Ce même blog note que la date limite des connaissances est passée de janvier 2025 à mars 2026 , soit un bond de 14 mois, offrant au modèle des données techniques et produits plus récentes. Longueur du contexte : La même source cite une fenêtre de contexte de plus d' un million de jetons , avec une sortie maximale d'environ 65 536 jetons . Le journal des modifications de l'API de Google décrit 3.6 Flash comme un « cheval de trait » optimisé pour un raisonnement et des appels d'outils plus efficaces, ciblant les flux de travail de codage et les agents de longue durée plutôt que les courtes requêtes de discussion. Comment Gemini 3.6 Flash est-il apparu pour la première fois dans Antigravity ? Gemini 3.6 Flash est apparu dans Antigravity avant que la plupart des utilisateurs ne voient la documentation officielle, après que des testeurs ont remarqué un nouvel identifiant de modèle dans l'interface et partagé des captures d'écran sur les réseaux sociaux. Ces premières apparitions ont déclenché des jours de tests informels pendant que Google itérait sur le backend et finalisait les notes de version publiques. La preuve de cette apparition échelonnée provient de plusieurs sources indépendantes : Un blog spécialisé dans les fuites rapporte qu'un identifiant de modèle « gemini-3.6-flash-tiered » est apparu dans Antigravity aux premières heures du 21 juillet 2026, repéré par un testeur travaillant dans un environnement de pré-lancement. Un développeur sur X (anciennement Twitter) a posté que « Gemini 3.6 Flash, ID ‘gemini-3.6-flash-tiered’, est apparu dans Antigravity il y a quelques minutes », confirmant que le modèle était présent dans l'outil avant que Google n'annonce les prix et les fonctionnalités. Un autre article technique décrit Google Antigravity 2.0 recevant Gemini 3.6 Flash dans le cadre d'une mise à jour plus large, tout en avertissant que le déploiement était progressif : certains comptes ont vu le nouveau modèle immédiatement, d'autres après un délai attribué à la région et à la configuration du compte. Les conseils officiels de Google ont clarifié plus tard que Gemini 3.6 Flash alimente l'agent Antigravity par défaut dans « Gemini Managed Agents », bien que les développeurs puissent remplacer le réglage du modèle via l'API. Qu'est-ce que Google a modifié sous le capot par rapport à Gemini 3.5 Flash ? Gemini 3.6 Flash répond principalement aux plaintes des développeurs concernant la verbosité, l'utilisation des jetons et la lenteur des flux de travail dans la version 3.5 Flash. La documentation de Google et des tests indépendants montrent une consommation de jetons réduite, une tarification mise à jour et un mode de raisonnement plus agressif ciblé sur les tâches de codage complexes. Comparés côte à côte, les changements se présentent comme suit : Efficacité des jetons : Un blog de Google sur Antigravity rapporte que 3.6 Flash consomme jusqu'à 17 % de jetons de sortie en moins que 3.5 Flash sur l'Artificial Analysis Index, un benchmark synthétique conçu pour imiter les flux de travail de codage réels. Tarification : La couverture du lancement par Ars Technica note une tarification API de 1,50 $ par million de jetons d'entrée et 7,50 $ par million de jetons de sortie , en baisse par rapport aux 9 $ par million de jetons de sortie de la version 3.5 Flash. Raisonnement : Un guide technique explique que le « mode réflexion » est activé par défaut et peut se voir attribuer un budget illimité, permettant au modèle d'exécuter davantage d'étapes de raisonnement interne pour les tâches difficiles sans forcer les développeurs à gérer cette complexité manuellement. Variantes : Le même guide décrit une variante « 3.6 Flash Low » destinée aux modifications bien ciblées, à la génération de tests et aux changements sur un seul fichier, la version complète de 3.6 Flash étant réservée aux flux de travail agentiques plus lourds. Le journal des modifications de Google souligne que ces optimisations visent les flux de travail de bout en bout, et pas seulement les réponses uniques, en réduisant les appels d'outils et les boucles d'itération au sein des agents construits sur le modèle. Comment Gemini 3.6 Flash se comporte-t-il dans Antigravity pour les développeurs actuellement ? Au sein d'Antigravity 2.0, Gemini 3.6 Flash se place au centre de l'IDE axé sur les agents de Google. Il alimente la migration de code, la refactorisation et les simulations multi-utilisateurs tout en exposant des options de configuration pour changer de modèle ou limiter le budget de raisonnement de l'agent pour des raisons de sécurité et de contrôle des coûts. D'après les exemples de Google et les analyses tierces, les comportements actuels d'Antigravity incluent : Migration de code : Le blog Antigravity de Google montre 3.6 Flash gérant la modernisation de logiciels hérités, déplaçant l'ancien code vers des frameworks plus récents avec une latence plus faible et une meilleure qualité par rapport à 3.5 Flash. Canevas interactifs : Une analyse en mandarin décrit des démonstrations d'Antigravity où 3.6 Flash construit des canevas interactifs et orchestre des flux de travail SDK, coordonnant plusieurs outils et fichiers depuis l'IDE. Simulations multi-utilisateurs : La même source rapporte que Google utilise Antigravity et 3.6 Flash pour simuler plusieurs utilisateurs modifiant un éditeur Markdown hors ligne, mettant à l'épreuve la coordination à long contexte. Valeurs par défaut des agents : Un article de Google AI Studio indique que Gemini 3.6 Flash est désormais le moteur par défaut de l'agent Antigravity au sein de Gemini Managed Agents, avec une chaîne de version d'agent spécifique liée à la configuration de prévisualisation. Les développeurs qui souhaitent rester sur d'anciens modèles peuvent toujours changer le sélecteur de modèle d'Antigravity, mais certains messages de la communauté décrivent le déploiement de 3.6 Flash comme une « mise à jour forcée pour les résistants de l'IDE », reflétant la frustration face au changement des paramètres par défaut. Comment les premiers utilisateurs réagissent-ils à Gemini 3.6 Flash dans Antigravity ? Les retours des utilisateurs d'Antigravity sont très mitigés. Beaucoup apprécient le backend plus rapide et la réduction de la facture de jetons. D'autres se plaignent que l'expérience utilisateur a régressé et que le modèle semble parfois moins précis que 3.5 Flash malgré les améliorations architecturales. Les réactions publiques recueillies sur les forums et les blogs montrent cette divergence : Un article sur un site axé sur l'IA qualifie Gemini 3.6 Flash de « monstre backend ultra-rapide » mais de « désastre frontend », citant des changements d'interface confus et des options de configuration difficiles à trouver dans l'interface mise à jour d'Antigravity. Dans un fil de discussion sur un forum de développeurs Google fin juillet 2026, un utilisateur prévient : « N'utilisez pas 3.6 Flash, c'est plus rapide mais plus idiot et stupide que 3.5 Flash », se plaignant que les suggestions de code soient devenues plus superficielles alors que la latence s'est améliorée. La même discussion de forum note des erreurs intermittentes où Antigravity échoue à exécuter des tâches avec 3.6 Flash sélectionné, incitant certains utilisateurs à revenir aux modèles précédents pendant que Google corrige les problèmes. En revanche, plusieurs développeurs sur X soulignent des refactorisations multi-fichiers plus fluides et moins d'appels d'outils, avec une démonstration comparative du compte officiel d'Antigravity montrant 3.6 Flash modernisant du code hérité plus rapidement que 3.5 Flash. Le fossé entre les métriques backend et l'expérience frontend est devenu un thème central de la couverture initiale. La documentation de Google se concentre sur les chiffres des jetons et de la latence, tandis que les testeurs de la communauté se concentrent sur le ressenti de ces changements dans les flux de travail quotidiens de l'IDE. Quelle est la prochaine étape pour Gemini 3.6 Flash et les utilisateurs d'Antigravity ? Gemini 3.6 Flash est désormais un modèle disponible au grand public sans date d'obsolescence annoncée, et Google le traite comme le moteur standard pour le codage agentique à court terme. Les développeurs peuvent s'attendre à des mises à jour incrémentielles d'Antigravity et de l'API Gemini plutôt qu'à un autre remplacement immédiat du modèle. Les signaux émanant de Google et de la couverture de l'écosystème suggèrent plusieurs développements à court terme : Horizon de support : La page d'obsolescence de Google répertorie Gemini 3.6 Flash avec une date de lancement au 21 juillet 2026 et note qu'aucune date d'arrêt n'a été fixée, ce qui implique un support sur plusieurs années. Stabilité du déploiement : Une explication sur le déploiement régional provenant d'un blog tiers indique aux utilisateurs que les entrées 3.6 Flash manquantes dans le menu des modèles d'Antigravity sont probablement dues à une disponibilité échelonnée, et non à une annulation. Conseils d'évaluation : Le même guide exhorte les équipes à effectuer des comparaisons côte à côte, en faisant passer les projets non critiques sur 3.6 Flash et en comparant les résultats avec les valeurs par défaut existantes sur au moins une semaine de travail réel. Intégration en entreprise : Google déclare que les entreprises peuvent accéder à 3.6 Flash via la plateforme Gemini Enterprise Agent et l'application Gemini Enterprise, étendant les flux de travail de type Antigravity aux environnements d'entreprise. Pour l'instant, Antigravity reste le principal banc d'essai de Google pour le codage agentique, et Gemini 3.6 Flash est le modèle sous examen. Les développeurs sont encouragés à mesurer les coûts réels des flux de travail et la qualité des résultats, et non seulement les benchmarks principaux, avant de s'engager pleinement dans la nouvelle valeur par défaut.

Nic Reeve·
Avos mise sur les agents d'IA pour transformer l'actualité en briefings quotidiens personnalisés
AI & Tech

Avos mise sur les agents d'IA pour transformer l'actualité en briefings quotidiens personnalisés

Avos propulse les briefings d'IA personnalisés au cœur de l'actualité alors que la startup basée à Chypre dévoile un produit conçu pour transformer une couverture en ligne tentaculaire en éditions concises et récurrentes, adaptées aux intérêts de chaque lecteur. Le concept de l'entreprise est simple : au lieu de forcer les utilisateurs à faire défiler des flux interminables, Avos utilise des agents d'IA pour effectuer la lecture, le filtrage, la déduplication et la synthèse avant de fournir un briefing finalisé. Dans des reportages récents, le fondateur et PDG Stef Roussos a décrit le produit comme une « plateforme d'actualités et de recherche agentique » conçue autour de briefings récurrents personnalisés, avec des éditions façonnées par les sujets, les sources, les marchés, le ton et le calendrier. Ce positionnement place Avos dans un segment en pleine croissance du marché de l'intelligence artificielle, où les entreprises dépassent le stade des chatbots pour se diriger vers des systèmes capables d'accomplir de manière autonome des tâches de connaissance en plusieurs étapes. Dans le cas d'Avos, la mission n'est pas de générer des résumés ponctuels, mais de produire un service d'actualités récurrent qui vise à ressembler à une première page privée pour chaque lecteur. Un produit de briefing, et non un simple flux Selon des rapports récents, Avos s'articule autour d'un flux de travail simple : un utilisateur décrit ce qu'il souhaite suivre en langage courant, et la plateforme effectue la recherche en arrière-plan. Elle rassemble ensuite les articles de son catalogue de sources, supprime les doublons et assemble un briefing unique livré avant que l'utilisateur ne commence sa journée. Cette approche reflète une évolution plus large du secteur. De nombreux outils d'actualités par IA se concentrent sur la synthèse, mais Avos est structuré autour de la publication récurrente. Au lieu de demander aux utilisateurs de revenir sans cesse sur un flux, l'entreprise cherche à leur offrir une édition finie qui réduit la surcharge informationnelle. Cette distinction est au cœur de l'identité de la startup et des propos tenus publiquement par Roussos. Les couvertures médiatiques récentes indiquent également qu'Avos peut livrer des briefings dans six langues et inclure des blocs de données financières en temps réel pour les actions, les cryptomonnaies, le forex et les matières premières. Le service a été décrit comme proposant une offre gratuite financée par la publicité, ainsi que des formules payantes supprimant les publicités et étendant la capacité et les fonctionnalités. Stef Roussos présente l'IA comme un changement économique Roussos a fait valoir que les avancées de l'IA agentique ont modifié l'économie de l'information personnalisée. Dans les articles liés au lancement, il a affirmé que la plateforme peut effectuer une grande partie du travail de recherche de manière personnalisée et le synthétiser en une première page pertinente pour chaque lecteur, pour un coût de génération mesuré d'environ trois cents par briefing. Cette structure de coût est importante car elle souligne la thèse de l'entreprise : si les agents peuvent gérer de manière fiable la recherche, le filtrage et le recoupement à grande échelle, alors des produits éditoriaux hautement personnalisés peuvent devenir économiquement viables pour les consommateurs, et non plus seulement pour les institutions. Avos parie essentiellement sur le fait que l'automatisation peut rendre la curation d'informations premium suffisamment abordable pour atteindre un large public. L'entreprise a également souligné qu'elle ne cherche pas à remplacer le journalisme. Au contraire, son produit est présenté comme une couche supplémentaire aidant les lecteurs à traiter le volume d'informations disponibles. Dans ce modèle, les éditeurs humains continuent de produire la couverture sous-jacente, tandis qu'Avos tente de l'organiser dans un format spécifique au lecteur. Atlas, les ancres et l'infrastructure derrière le produit Dans ses interviews, Roussos a expliqué que l'entreprise a développé un système backend appelé Atlas pour gérer le travail complexe de recherche, d'ingestion, de traitement et de déduplication de contenu provenant de milliers de sources. Ce type d'infrastructure est essentiel à tout produit de briefing agentique, car la qualité du résultat dépend fortement de la couverture des sources, de leur classement et du nettoyage des données avant le début de la génération. L'entreprise a également introduit le « Anchor Mode », décrit comme une expérience audio interactive qui fonctionne comme un podcast d'actualités, mais qui permet aux auditeurs de poser des questions pour une exploration plus approfondie. Cette fonctionnalité suggère qu'Avos expérimente bien plus que la simple livraison de texte, visant à transformer les briefings en un produit d'information multi-format pouvant être consommé de différentes manières tout au long de la journée. La version bêta privée a débuté en mars 2026, selon les rapports de lancement, avant que la plateforme ne passe à une version publique en août 2026. Ce calendrier suggère qu'Avos a passé plusieurs mois à affiner son processus de briefing avant de l'ouvrir plus largement aux utilisateurs. Pourquoi ce lancement est important aujourd'hui Avos arrive à un moment où les entreprises d'IA cherchent à prouver que les agents peuvent accomplir des tâches plus pratiques que répondre à de simples invites. Les briefings d'actualités et de recherche constituent un cas d'étude naturel, car ils exigent une consultation répétée, une comparaison des sources, un filtrage et une synthèse concise — autant de tâches difficiles à effectuer efficacement à grande échelle pour les humains au quotidien. Le modèle de la startup reflète également la demande croissante de personnalisation dans les produits d'information professionnels. Les traders, fondateurs, analystes et opérateurs souhaitent souvent un rapport signal/bruit plus précis que ce qu'offre un flux généraliste. En combinant les préférences de sources, le contexte du marché, le ton et le timing, Avos cible des utilisateurs qui privilégient la spécificité au volume. Parallèlement, le produit soulève des questions familières sur la fiabilité, la transparence éditoriale et la dépendance à la synthèse automatisée. Ces questions ne sont pas propres à Avos, mais elles sont particulièrement pertinentes lorsqu'une plateforme se positionne comme une source récurrente d'actualités et de recherche plutôt que comme un simple outil de recherche ou de résumé. Et ensuite ? Pour l'instant, Avos se présente comme une application pratique de l'IA agentique plutôt que comme une spéculation. Son message de lancement se concentre sur une promesse claire : les utilisateurs définissent l'agenda et le logiciel effectue la lecture. Si l'entreprise parvient à fournir systématiquement des briefings précis, opportuns et réellement utiles, elle pourrait contribuer à définir une catégorie située entre l'agrégation d'actualités, la curation éditoriale et la recherche automatisée. Le véritable test sera de savoir si les briefings personnalisés peuvent devenir une habitude quotidienne pour les utilisateurs au-delà d'un groupe restreint d'adoptants précoces. Si c'est le cas, Avos pourrait devenir l'un des exemples les plus visibles de la manière dont l'IA agentique commence à remodeler la consommation d'informations.

Nic Reeve·
IA : Claude d'Anthropic participe à hauteur d'un quart au développement de son successeur
AI & Tech

IA : Claude d'Anthropic participe à hauteur d'un quart au développement de son successeur

AInews : Claude d'Anthropic prend une part de quart dans la création de son propre successeur Le 17 septembre 2026, Anthropic a révélé que son chatbot Claude dirige désormais 26 % de la recherche et du développement de l'entreprise sur les futurs modèles d'IA, une étape que la firme présente comme un exemple précoce de la manière dont les systèmes d'intelligence artificielle peuvent aider à construire leurs propres successeurs sous une supervision humaine stricte. Quelle part du travail de R&D d'Anthropic est désormais gérée par Claude ? Anthropic rapporte que Claude « dirige » 26 % de sa recherche et de son développement de modèles internes en août 2026, contre environ 1 % en mars 2026, ce qui signifie que le système peut mener la majeure partie d'une tâche à partir d'une instruction de haut niveau, tandis que les humains supervisent et approuvent chaque étape. Anthropic a détaillé la charge de travail de Claude en utilisant une échelle d'autonomie développée par Epoch AI, une organisation à but non lucratif indépendante qui suit les progrès des systèmes d'intelligence artificielle. L'entreprise et des analyses externes ont rapporté les chiffres et le calendrier suivants : Selon l'article de blog d'Anthropic du 17 septembre 2026 : Claude dirigeait 26 % du travail de R&D des modèles mesuré en août 2026. Selon Reuters, les mesures de mars 2026 montraient que Claude dirigeait environ 1 % de ce travail sur la même échelle. Le cadre d'Epoch AI qualifie le niveau actuel d' AL4, « dirige », où l'IA peut gérer la majeure partie d'une tâche de bout en bout à partir d'une instruction de haut niveau, avec une supervision humaine tout au long du processus. Anthropic a déclaré aux journalistes que la contribution de Claude est passée de moins de 1 % en février à environ un quart du travail mesuré en août 2026. La couverture technologique du Washington Post a décrit cette part de 26 % comme étant « plus d'un quart » de la recherche et du développement d'Anthropic, soulignant la rapidité avec laquelle l'entreprise a transféré des tâches d'ingénierie de base entre les mains de son propre chatbot. Claude est-il pleinement autonome pour construire sa prochaine version ? Anthropic affirme que Claude n'est pas encore pleinement autonome, soulignant que les humains restent « dans la boucle » et qu'aucune partie du travail mesuré n'a atteint le niveau d'autonomie le plus élevé, où un système d'IA concevrait, entraînerait et approuverait complètement son successeur sans surveillance humaine. Dans ses mesures publiques, Anthropic a tracé une ligne claire entre collaboration et autonomie. L'entreprise et des explications externes rapportent : Selon le blog d'Anthropic et la couverture de Reuters, 0 % du travail mesuré a atteint le niveau d'autonomie complète AL5 en août 2026. Anthropic a déclaré que Claude « n'opère pas de manière pleinement autonome dans aucune partie du travail mesuré » et que les humains supervisent, examinent et peuvent bloquer ses actions. Selon un résumé technique, Claude écrit actuellement du code d'infrastructure, lance des expériences, analyse les résultats et examine les modifications, mais il ne fixe pas les objectifs de l'entreprise, ne décide pas des politiques de déploiement et ne contrôle pas l'intégralité du processus d'entraînement. L'échelle d'autonomie publiée par Anthropic, adaptée d'Epoch AI, distingue l'IA qui assiste , collabore , dirige et enfin opère de manière autonome , et place Claude au deuxième échelon le plus élevé. La couverture de médias tels qu'ABC News et The Washington Post a souligné que malgré les titres de presse sur l'IA qui « se construit elle-même », Claude dépend toujours de chercheurs humains pour la direction, les garde-fous et l'approbation finale à chaque étape. Quel type de travail Claude effectue-t-il pour construire son successeur ? Claude réalise désormais une large gamme de tâches techniques dans le pipeline de recherche de modèles d'Anthropic, notamment l'écriture et la correction de code, la conception d'expériences, l'exécution de tâches d'entraînement et d'évaluation, et l'aide à l'interprétation des résultats qui alimentent la conception des futures versions de Claude. Les divulgations d'Anthropic, ainsi que les analyses des médias technologiques, décrivent le rôle de Claude en termes concrets et axés sur l'ingénierie : Selon les mesures d'Anthropic de septembre 2026, Claude écrit de plus en plus de code d'infrastructure utilisé pour entraîner et évaluer de nouveaux modèles, sous réserve d'examen humain. L'entreprise affirme que Claude aide désormais à concevoir des expériences , à configurer des exécutions sur des clusters de calcul et à ajuster les paramètres, en basant ses décisions sur les objectifs de haut niveau fixés par les chercheurs humains. Des rapports de sites spécialisés en technologie indiquent que Claude analyse désormais les résultats expérimentaux , suggérant des modifications d'architectures, de fonctions de perte ou de sélection de données que les humains peuvent accepter ou rejeter. Anthropic a déclaré aux journalistes que plus de 90 % de son travail de R&D implique désormais des systèmes d'IA collaborant avec des humains au niveau « l'IA collabore » ou supérieur sur l'échelle d'autonomie. Selon ABC News et The Washington Post, l'entreprise caractérise ces contributions comme des « pans importants de travail » effectués sous une « direction humaine étroite », et non comme une prise de décision indépendante. Des commentateurs externes ont décrit le rôle de Claude comme dépassant la simple complétion de code ou la génération de documentation pour aider à structurer des projets de recherche entiers, même si les chercheurs choisissent toujours les objectifs et examinent chaque étape. Pourquoi Anthropic a-t-elle publié des mesures d'autonomie, et qui a créé l'échelle ? Anthropic a publié des mesures détaillées du rôle de Claude afin de donner aux décideurs politiques, aux chercheurs et au public une vision plus claire de la rapidité avec laquelle les systèmes d'IA contribuent au développement de l'IA, en utilisant une échelle d'autonomie à cinq niveaux développée avec la contribution d'Epoch AI, une organisation à but non lucratif indépendante qui suit cette technologie. L'article de blog d'Anthropic du 17 septembre 2026 explique que le laboratoire prévoit de rapporter régulièrement ces chiffres afin que les observateurs extérieurs puissent évaluer les progrès vers des systèmes qui pourraient un jour construire une IA plus avancée avec une intervention humaine limitée. Cette annonce, ainsi que la couverture par les publications financières et technologiques, mettent en lumière plusieurs aspects de cette approche : Selon Finimize, Anthropic a déclaré qu'elle « continuera à publier des statistiques » sur la rapidité avec laquelle l'IA commence à construire l'IA, en utilisant l'échelle d'autonomie comme un étalon commun. Reuters a rapporté qu'Anthropic voit ces chiffres comme des indicateurs précoces de progrès vers l'« auto-amélioration récursive », un scénario où l'IA s'améliore elle-même sans dépendre des ingénieurs humains pour chaque itération. L'échelle d'autonomie d'Epoch AI, citée par Anthropic et de nombreux médias, définit des niveaux allant de l'AL1 (l'IA assiste les humains sur des tâches étroites) à l'AL5 (l'IA opère de manière autonome sur l'ensemble du pipeline de développement). Les mesures internes d'Anthropic placent la majeure partie du travail de Claude au niveau AL3 (« collabore ») et AL4 (« dirige »), aucune tâche n'ayant atteint le niveau AL5 en août 2026. L'Institute for AI Safety and Systems de l'entreprise a publié une note de recherche intitulée « When AI builds itself » (Quand l'IA se construit elle-même), décrivant comment, avec suffisamment de puissance de calcul, l'autonomie pourrait s'étendre à la conception, l'entraînement et le déploiement de systèmes successeurs. Les dirigeants d'Anthropic ont soutenu lors d'entretiens publics qu'une telle transparence peut aider les régulateurs à suivre les risques à mesure que les systèmes d'IA assument une plus grande part du travail de construction de la nouvelle IA, plutôt que de laisser les progrès visibles uniquement à l'intérieur des laboratoires d'entreprises. Comment la poussée d'auto-amélioration de Claude s'inscrit-elle dans le programme de sécurité plus large d'Anthropic ? Anthropic présente le rôle croissant de Claude dans le développement de modèles à la fois comme un gain d'efficacité et comme un cas d'étude pour les mesures de sécurité conçues pour maintenir le contrôle humain sur les systèmes d'IA qui aident à construire des successeurs plus capables, incluant une surveillance stricte, des contraintes sur les actions et la possibilité de suspendre l'entraînement si les risques augmentent. Anthropic a passé une grande partie de l'année 2026 à mettre en garde publiquement contre les risques d'une IA progressant rapidement, tout en faisant progresser ses propres modèles. Plus tôt dans l'année, l'entreprise a exhorté les laboratoires de pointe à coordonner d'éventuelles pauses dans le développement si les critères de sécurité suggèrent un danger croissant : Le 4 juin 2026, Reuters a rapporté qu'Anthropic appelait à un « plan coordonné » entre les principaux développeurs d'IA pour interrompre le développement si les risques dépassent les seuils convenus, citant des capacités croissantes dans l'exécution de tâches et l'auto-amélioration des systèmes. Selon ce rapport, Anthropic a déclaré que la capacité de l'IA à accomplir des tâches complexes de manière autonome avait doublé environ tous les quatre mois, pointant vers la possibilité d'une auto-amélioration récursive. Dans sa note de recherche « When AI builds itself » datée du 18 septembre 2026, l'Institut d'Anthropic a exposé des scénarios où les futurs systèmes pourraient concevoir et entraîner de manière autonome des successeurs, soulignant la nécessité d'une gouvernance et de contrôles techniques avant l'émergence de tels systèmes. Les divulgations actuelles soulignent que Claude ne choisit pas les objectifs de l'entreprise, ne peut pas approuver son propre déploiement et opère sous des garde-fous qui permettent au personnel humain d'arrêter ou d'inverser des actions. La couverture par les médias d'information généraux fait écho à ce double message : Anthropic s'efforce d'exploiter l'IA pour construire une meilleure IA, tout en insistant publiquement sur le fait que les garde-fous et la capacité de suspendre le processus doivent suivre le rythme des progrès techniques. Qui est affecté par le rôle élargi de Claude, et que pourrait-il se passer ensuite ? Le rôle élargi de Claude dans la R&D d'Anthropic affecte les ingénieurs au sein de l'entreprise, les laboratoires d'IA rivaux qui observent l'expérience, les régulateurs qui suivent l'automatisation des systèmes critiques et les investisseurs qui évaluent l'économie de la recherche pilotée par l'IA, Anthropic signalant qu'elle s'attend à ce que la part de l'IA dans le travail de développement continue de croître dans les mois à venir. Les rapports des médias financiers et technologiques esquissent les implications à court terme : Selon Finimize et Reuters, les chiffres d'Anthropic montrent que les systèmes d'IA assument une part croissante du travail de recherche coûteux, ce qui pourrait réduire les coûts d'entraînement et d'expérimentation sur les grands modèles à moyen terme. Les articles de journalisme technologique notent que des laboratoires rivaux tels qu'OpenAI et Google DeepMind utilisent déjà des outils d'IA en interne, et pourraient faire face à des pressions pour publier des mesures comparables sur la part de leur propre travail désormais dirigée par l'IA. Les analystes politiques cités dans la couverture affirment que des rapports réguliers sur les niveaux d'autonomie pourraient influencer les propositions réglementaires sur la transparence, l'audit et les exigences de présence humaine (« human-in-the-loop ») pour le développement de l'IA de pointe. L'Institut d'Anthropic suggère que si l'autonomie continue d'augmenter, les futures mises à jour pourraient montrer des systèmes d'IA non seulement concevant des expériences, mais aussi proposant de nouvelles architectures, des pipelines d'entraînement et des stratégies de sécurité à grande échelle. Des experts externes avertissent qu'une fois que les systèmes d'IA pourront concevoir et entraîner pleinement des successeurs avec une intervention humaine limitée, les questions de responsabilité et de contrôle deviendront bien plus aiguës que dans les configurations supervisées d'aujourd'hui. Anthropic n'a pas donné de prévision précise sur le moment où Claude ou ses successeurs pourraient atteindre le niveau d'autonomie le plus élevé. L'entreprise s'est plutôt engagée à publier régulièrement des mesures sur le travail dirigé par l'IA et à collaborer avec des organisations à but non lucratif telles qu'Epoch AI pour affiner les méthodes de mesure de la proximité des systèmes d'IA avec la construction de la prochaine génération d'eux-mêmes.

Nic Reeve·