allnewscastallnewscast
Breaking News
AI & Tech

L'IA aux commandes d'un F-16 tandis que le Chelsea Flower Show met à l'honneur les technologies de jardinage

Nic Reeve5 min de lecture
L'IA aux commandes d'un F-16 tandis que le Chelsea Flower Show met à l'honneur les technologies de jardinage

Cet été, l'intelligence artificielle a franchi une nouvelle étape visible, passant des démonstrations en laboratoire aux systèmes du monde réel : un programme a piloté un F-16 sous contrôle IA, tandis qu'un autre a intégré l'IA au cœur du Chelsea Flower Show. Cette même période a également vu apparaître de nouvelles mises à jour de produits et de plateformes autour de la conception assistée par IA et des outils grand public, soulignant la rapidité avec laquelle cette technologie se propage dans les secteurs de la défense, de la création et des logiciels du quotidien.

Lors de l'essai militaire le plus marquant, Lockheed Martin a annoncé qu'un agent IA avait piloté un F-16 lourdement modifié lors de 27 interceptions de cibles réelles, au cours d'une campagne de huit sorties à la base aérienne d'Edwards, en Californie. L'appareil a utilisé un pod Lockheed Martin Legion pour suivre une cible, et les données de ciblage ont été transmises à l'agent IA embarqué, qui a ensuite manœuvré l'avion en position d'interception. L'entreprise a déclaré que l'essai démontrait une boucle « capteur-action » plus rapide dans un environnement de combat aérien, tout en maintenant un pilote dans la structure de sécurité durant les essais.

Un rapport distinct sur les travaux VENOM de l'U.S. Air Force et de la DARPA indique qu'un F-16 modifié a été piloté sous contrôle IA à la base aérienne d'Eglin, en Floride, avec un pilote humain dans le cockpit prêt à reprendre les commandes. Ce programme a débuté par des vols de validation en juin 2026 pour vérifier les mises à niveau matérielles et logicielles, avant de passer, en juillet, à des missions où l'IA gérait certaines phases du vol. Ensemble, ces tests montrent comment l'autonomie dépasse le stade de la simulation pour s'intégrer à des opérations aériennes contrôlées sur des avions réels.

L'importance pour la défense ne réside pas seulement dans le fait qu'un algorithme puisse piloter un jet, mais qu'il puisse le faire de manière répétée dans un contexte opérationnel contraint. Selon les rapports, le système d'IA a été couplé à du matériel et des capteurs améliorés plutôt qu'à un avion entièrement redessiné, ce qui suggère que l'accent est actuellement mis sur l'intégration et la fiabilité plutôt que sur le remplacement pur et simple des pilotes. Cette distinction est importante car elle montre que la technologie est conçue comme un multiplicateur de force, et non comme un substitut autonome au jugement humain.

Ailleurs, le Chelsea Flower Show a offert une image très différente de l'extension du champ d'application de l'IA. La couverture de l'édition 2026 a mis en lumière des outils de conception de jardins et de surveillance des plantes assistés par IA, notamment une plateforme appelée Spacelift, présentée comme un système destiné à aider les propriétaires à planifier, concevoir et gérer leurs espaces extérieurs. Les débuts de cette plateforme reflètent une tendance plus large observée lors du salon : l'intelligence artificielle est de plus en plus utilisée pour façonner les paysages, et non plus seulement pour les analyser.

Parallèlement, l'IA à Chelsea ne s'est pas limitée aux logiciels de conception. Les reportages de la BBC sur l'événement de 2026 ont décrit une technologie de scan de la santé des plantes ayant été primée, tandis que d'autres articles mentionnaient des outils et des présentations basés sur l'IA visant à aider les jardiniers à comprendre le stress des plantes, les besoins en irrigation et l'entretien à long terme. La Royal Horticultural Society a également été associée à des projets visant une utilisation plus large de l'IA dans les bases de données botaniques et la planification des jardins, ce qui suggère que la technologie pourrait devenir un outil pratique plutôt qu'une simple nouveauté sans lendemain.

La réaction au sein du monde du jardinage est mitigée. Certains concepteurs considèrent l'IA comme une aide à la planification utile, capable d'accélérer le travail de mise en page, d'améliorer la visualisation et d'appuyer les décisions d'entretien. D'autres craignent que la technologie ne standardise la conception en résultats formels ou ne dévalorise le savoir-faire des paysagistes humains. Cette tension était visible dans la couverture du Chelsea Flower Show 2026, où les jardins générés ou assistés par IA sont devenus un sujet de débat à part entière.

Ce qui lie les essais du F-16 et le Chelsea Flower Show, ce n'est pas la technologie elle-même, mais le stade qu'elle a atteint. Dans les deux cas, l'IA sort des présentations spéculatives pour entrer dans des environnements appliqués avec des contraintes réelles : dynamique de vol complexe d'un côté, écosystèmes vivants et attentes des clients de l'autre. Le message sous-jacent est le même : l'IA devient moins une promesse abstraite qu'un outil opérationnel.

Ce changement soulève également une question plus large pour l'industrie. À mesure que les systèmes d'IA sont déployés dans des domaines aussi différents que l'aviation militaire et la conception de jardins, la mesure du succès passe de la capacité brute à la performance fiable. Le système peut-il agir de manière sûre, explicable et cohérente lorsque les conditions changent ? Les humains peuvent-ils le superviser efficacement ? La technologie peut-elle produire des résultats que les utilisateurs souhaitent réellement ? Les exemples récents suggèrent que ces questions sont désormais au cœur de l'évaluation de l'IA.

Pour l'instant, la situation est celle d'une diversification rapide. Un avion de chasse peut être partiellement dirigé par un agent IA. Un salon de jardinage peut présenter des outils de conception et de santé des plantes assistés par IA. Les logiciels grand public peuvent prétendre aider les gens à créer et à gérer des espaces extérieurs avec l'assistance de machines. Le fil conducteur est que l'IA n'est plus confinée aux démonstrations logicielles ; elle est de plus en plus testée dans le monde physique, là où les conséquences sont visibles et les exigences plus élevées.

Lire la suite

Articles connexes

Gemini 3.6 Flash devient discrètement le nouveau moteur par défaut d’Antigravity
AI & Tech

Gemini 3.6 Flash devient discrètement le nouveau moteur par défaut d’Antigravity

Le 21 juillet 2026, Google a déployé Gemini 3.6 Flash sur l'ensemble de sa pile technologique pour développeurs. La communauté AInews a repéré le nouveau modèle en fonctionnement au sein de l'IDE Antigravity quelques jours avant que l'entreprise ne documente officiellement le changement. Ce déploiement fait de 3.6 Flash le moteur par défaut des outils de codage « agentiques » de Google. Qu'est-ce que Gemini 3.6 Flash exactement et quand est-il arrivé ? Gemini 3.6 Flash est la toute dernière génération de modèles de langage « rapides et économiques » de Google. Lancé le 21 juillet 2026 en tant que mise à jour grand public de Gemini 3.5 Flash, il se concentre sur la réduction des coûts de jetons (tokens) et de la latence, tout en améliorant le codage, le travail de connaissance et les tâches multimodales. Il a été lancé le même jour sur Antigravity, l'API Gemini et les produits pour développeurs associés. Les faits clés recueillis dans la documentation de Google et sur des blogs techniques indépendants dressent un calendrier précis : Date de sortie : Selon le catalogue de modèles Gemini Enterprise de Google, Gemini 3.6 Flash a atteint la disponibilité générale (GA) le 21 juillet 2026 . Couverture : Un blog spécialisé pour les développeurs rapporte que le modèle a été mis en ligne simultanément dans l'application Gemini, Google Antigravity, AI Studio et Android Studio le même jour. Fenêtre de connaissances : Ce même blog note que la date limite des connaissances est passée de janvier 2025 à mars 2026 , soit un bond de 14 mois, offrant au modèle des données techniques et produits plus récentes. Longueur du contexte : La même source cite une fenêtre de contexte de plus d' un million de jetons , avec une sortie maximale d'environ 65 536 jetons . Le journal des modifications de l'API de Google décrit 3.6 Flash comme un « cheval de trait » optimisé pour un raisonnement et des appels d'outils plus efficaces, ciblant les flux de travail de codage et les agents de longue durée plutôt que les courtes requêtes de discussion. Comment Gemini 3.6 Flash est-il apparu pour la première fois dans Antigravity ? Gemini 3.6 Flash est apparu dans Antigravity avant que la plupart des utilisateurs ne voient la documentation officielle, après que des testeurs ont remarqué un nouvel identifiant de modèle dans l'interface et partagé des captures d'écran sur les réseaux sociaux. Ces premières apparitions ont déclenché des jours de tests informels pendant que Google itérait sur le backend et finalisait les notes de version publiques. La preuve de cette apparition échelonnée provient de plusieurs sources indépendantes : Un blog spécialisé dans les fuites rapporte qu'un identifiant de modèle « gemini-3.6-flash-tiered » est apparu dans Antigravity aux premières heures du 21 juillet 2026, repéré par un testeur travaillant dans un environnement de pré-lancement. Un développeur sur X (anciennement Twitter) a posté que « Gemini 3.6 Flash, ID ‘gemini-3.6-flash-tiered’, est apparu dans Antigravity il y a quelques minutes », confirmant que le modèle était présent dans l'outil avant que Google n'annonce les prix et les fonctionnalités. Un autre article technique décrit Google Antigravity 2.0 recevant Gemini 3.6 Flash dans le cadre d'une mise à jour plus large, tout en avertissant que le déploiement était progressif : certains comptes ont vu le nouveau modèle immédiatement, d'autres après un délai attribué à la région et à la configuration du compte. Les conseils officiels de Google ont clarifié plus tard que Gemini 3.6 Flash alimente l'agent Antigravity par défaut dans « Gemini Managed Agents », bien que les développeurs puissent remplacer le réglage du modèle via l'API. Qu'est-ce que Google a modifié sous le capot par rapport à Gemini 3.5 Flash ? Gemini 3.6 Flash répond principalement aux plaintes des développeurs concernant la verbosité, l'utilisation des jetons et la lenteur des flux de travail dans la version 3.5 Flash. La documentation de Google et des tests indépendants montrent une consommation de jetons réduite, une tarification mise à jour et un mode de raisonnement plus agressif ciblé sur les tâches de codage complexes. Comparés côte à côte, les changements se présentent comme suit : Efficacité des jetons : Un blog de Google sur Antigravity rapporte que 3.6 Flash consomme jusqu'à 17 % de jetons de sortie en moins que 3.5 Flash sur l'Artificial Analysis Index, un benchmark synthétique conçu pour imiter les flux de travail de codage réels. Tarification : La couverture du lancement par Ars Technica note une tarification API de 1,50 $ par million de jetons d'entrée et 7,50 $ par million de jetons de sortie , en baisse par rapport aux 9 $ par million de jetons de sortie de la version 3.5 Flash. Raisonnement : Un guide technique explique que le « mode réflexion » est activé par défaut et peut se voir attribuer un budget illimité, permettant au modèle d'exécuter davantage d'étapes de raisonnement interne pour les tâches difficiles sans forcer les développeurs à gérer cette complexité manuellement. Variantes : Le même guide décrit une variante « 3.6 Flash Low » destinée aux modifications bien ciblées, à la génération de tests et aux changements sur un seul fichier, la version complète de 3.6 Flash étant réservée aux flux de travail agentiques plus lourds. Le journal des modifications de Google souligne que ces optimisations visent les flux de travail de bout en bout, et pas seulement les réponses uniques, en réduisant les appels d'outils et les boucles d'itération au sein des agents construits sur le modèle. Comment Gemini 3.6 Flash se comporte-t-il dans Antigravity pour les développeurs actuellement ? Au sein d'Antigravity 2.0, Gemini 3.6 Flash se place au centre de l'IDE axé sur les agents de Google. Il alimente la migration de code, la refactorisation et les simulations multi-utilisateurs tout en exposant des options de configuration pour changer de modèle ou limiter le budget de raisonnement de l'agent pour des raisons de sécurité et de contrôle des coûts. D'après les exemples de Google et les analyses tierces, les comportements actuels d'Antigravity incluent : Migration de code : Le blog Antigravity de Google montre 3.6 Flash gérant la modernisation de logiciels hérités, déplaçant l'ancien code vers des frameworks plus récents avec une latence plus faible et une meilleure qualité par rapport à 3.5 Flash. Canevas interactifs : Une analyse en mandarin décrit des démonstrations d'Antigravity où 3.6 Flash construit des canevas interactifs et orchestre des flux de travail SDK, coordonnant plusieurs outils et fichiers depuis l'IDE. Simulations multi-utilisateurs : La même source rapporte que Google utilise Antigravity et 3.6 Flash pour simuler plusieurs utilisateurs modifiant un éditeur Markdown hors ligne, mettant à l'épreuve la coordination à long contexte. Valeurs par défaut des agents : Un article de Google AI Studio indique que Gemini 3.6 Flash est désormais le moteur par défaut de l'agent Antigravity au sein de Gemini Managed Agents, avec une chaîne de version d'agent spécifique liée à la configuration de prévisualisation. Les développeurs qui souhaitent rester sur d'anciens modèles peuvent toujours changer le sélecteur de modèle d'Antigravity, mais certains messages de la communauté décrivent le déploiement de 3.6 Flash comme une « mise à jour forcée pour les résistants de l'IDE », reflétant la frustration face au changement des paramètres par défaut. Comment les premiers utilisateurs réagissent-ils à Gemini 3.6 Flash dans Antigravity ? Les retours des utilisateurs d'Antigravity sont très mitigés. Beaucoup apprécient le backend plus rapide et la réduction de la facture de jetons. D'autres se plaignent que l'expérience utilisateur a régressé et que le modèle semble parfois moins précis que 3.5 Flash malgré les améliorations architecturales. Les réactions publiques recueillies sur les forums et les blogs montrent cette divergence : Un article sur un site axé sur l'IA qualifie Gemini 3.6 Flash de « monstre backend ultra-rapide » mais de « désastre frontend », citant des changements d'interface confus et des options de configuration difficiles à trouver dans l'interface mise à jour d'Antigravity. Dans un fil de discussion sur un forum de développeurs Google fin juillet 2026, un utilisateur prévient : « N'utilisez pas 3.6 Flash, c'est plus rapide mais plus idiot et stupide que 3.5 Flash », se plaignant que les suggestions de code soient devenues plus superficielles alors que la latence s'est améliorée. La même discussion de forum note des erreurs intermittentes où Antigravity échoue à exécuter des tâches avec 3.6 Flash sélectionné, incitant certains utilisateurs à revenir aux modèles précédents pendant que Google corrige les problèmes. En revanche, plusieurs développeurs sur X soulignent des refactorisations multi-fichiers plus fluides et moins d'appels d'outils, avec une démonstration comparative du compte officiel d'Antigravity montrant 3.6 Flash modernisant du code hérité plus rapidement que 3.5 Flash. Le fossé entre les métriques backend et l'expérience frontend est devenu un thème central de la couverture initiale. La documentation de Google se concentre sur les chiffres des jetons et de la latence, tandis que les testeurs de la communauté se concentrent sur le ressenti de ces changements dans les flux de travail quotidiens de l'IDE. Quelle est la prochaine étape pour Gemini 3.6 Flash et les utilisateurs d'Antigravity ? Gemini 3.6 Flash est désormais un modèle disponible au grand public sans date d'obsolescence annoncée, et Google le traite comme le moteur standard pour le codage agentique à court terme. Les développeurs peuvent s'attendre à des mises à jour incrémentielles d'Antigravity et de l'API Gemini plutôt qu'à un autre remplacement immédiat du modèle. Les signaux émanant de Google et de la couverture de l'écosystème suggèrent plusieurs développements à court terme : Horizon de support : La page d'obsolescence de Google répertorie Gemini 3.6 Flash avec une date de lancement au 21 juillet 2026 et note qu'aucune date d'arrêt n'a été fixée, ce qui implique un support sur plusieurs années. Stabilité du déploiement : Une explication sur le déploiement régional provenant d'un blog tiers indique aux utilisateurs que les entrées 3.6 Flash manquantes dans le menu des modèles d'Antigravity sont probablement dues à une disponibilité échelonnée, et non à une annulation. Conseils d'évaluation : Le même guide exhorte les équipes à effectuer des comparaisons côte à côte, en faisant passer les projets non critiques sur 3.6 Flash et en comparant les résultats avec les valeurs par défaut existantes sur au moins une semaine de travail réel. Intégration en entreprise : Google déclare que les entreprises peuvent accéder à 3.6 Flash via la plateforme Gemini Enterprise Agent et l'application Gemini Enterprise, étendant les flux de travail de type Antigravity aux environnements d'entreprise. Pour l'instant, Antigravity reste le principal banc d'essai de Google pour le codage agentique, et Gemini 3.6 Flash est le modèle sous examen. Les développeurs sont encouragés à mesurer les coûts réels des flux de travail et la qualité des résultats, et non seulement les benchmarks principaux, avant de s'engager pleinement dans la nouvelle valeur par défaut.

Nic Reeve·
Avos mise sur les agents d'IA pour transformer l'actualité en briefings quotidiens personnalisés
AI & Tech

Avos mise sur les agents d'IA pour transformer l'actualité en briefings quotidiens personnalisés

Avos propulse les briefings d'IA personnalisés au cœur de l'actualité alors que la startup basée à Chypre dévoile un produit conçu pour transformer une couverture en ligne tentaculaire en éditions concises et récurrentes, adaptées aux intérêts de chaque lecteur. Le concept de l'entreprise est simple : au lieu de forcer les utilisateurs à faire défiler des flux interminables, Avos utilise des agents d'IA pour effectuer la lecture, le filtrage, la déduplication et la synthèse avant de fournir un briefing finalisé. Dans des reportages récents, le fondateur et PDG Stef Roussos a décrit le produit comme une « plateforme d'actualités et de recherche agentique » conçue autour de briefings récurrents personnalisés, avec des éditions façonnées par les sujets, les sources, les marchés, le ton et le calendrier. Ce positionnement place Avos dans un segment en pleine croissance du marché de l'intelligence artificielle, où les entreprises dépassent le stade des chatbots pour se diriger vers des systèmes capables d'accomplir de manière autonome des tâches de connaissance en plusieurs étapes. Dans le cas d'Avos, la mission n'est pas de générer des résumés ponctuels, mais de produire un service d'actualités récurrent qui vise à ressembler à une première page privée pour chaque lecteur. Un produit de briefing, et non un simple flux Selon des rapports récents, Avos s'articule autour d'un flux de travail simple : un utilisateur décrit ce qu'il souhaite suivre en langage courant, et la plateforme effectue la recherche en arrière-plan. Elle rassemble ensuite les articles de son catalogue de sources, supprime les doublons et assemble un briefing unique livré avant que l'utilisateur ne commence sa journée. Cette approche reflète une évolution plus large du secteur. De nombreux outils d'actualités par IA se concentrent sur la synthèse, mais Avos est structuré autour de la publication récurrente. Au lieu de demander aux utilisateurs de revenir sans cesse sur un flux, l'entreprise cherche à leur offrir une édition finie qui réduit la surcharge informationnelle. Cette distinction est au cœur de l'identité de la startup et des propos tenus publiquement par Roussos. Les couvertures médiatiques récentes indiquent également qu'Avos peut livrer des briefings dans six langues et inclure des blocs de données financières en temps réel pour les actions, les cryptomonnaies, le forex et les matières premières. Le service a été décrit comme proposant une offre gratuite financée par la publicité, ainsi que des formules payantes supprimant les publicités et étendant la capacité et les fonctionnalités. Stef Roussos présente l'IA comme un changement économique Roussos a fait valoir que les avancées de l'IA agentique ont modifié l'économie de l'information personnalisée. Dans les articles liés au lancement, il a affirmé que la plateforme peut effectuer une grande partie du travail de recherche de manière personnalisée et le synthétiser en une première page pertinente pour chaque lecteur, pour un coût de génération mesuré d'environ trois cents par briefing. Cette structure de coût est importante car elle souligne la thèse de l'entreprise : si les agents peuvent gérer de manière fiable la recherche, le filtrage et le recoupement à grande échelle, alors des produits éditoriaux hautement personnalisés peuvent devenir économiquement viables pour les consommateurs, et non plus seulement pour les institutions. Avos parie essentiellement sur le fait que l'automatisation peut rendre la curation d'informations premium suffisamment abordable pour atteindre un large public. L'entreprise a également souligné qu'elle ne cherche pas à remplacer le journalisme. Au contraire, son produit est présenté comme une couche supplémentaire aidant les lecteurs à traiter le volume d'informations disponibles. Dans ce modèle, les éditeurs humains continuent de produire la couverture sous-jacente, tandis qu'Avos tente de l'organiser dans un format spécifique au lecteur. Atlas, les ancres et l'infrastructure derrière le produit Dans ses interviews, Roussos a expliqué que l'entreprise a développé un système backend appelé Atlas pour gérer le travail complexe de recherche, d'ingestion, de traitement et de déduplication de contenu provenant de milliers de sources. Ce type d'infrastructure est essentiel à tout produit de briefing agentique, car la qualité du résultat dépend fortement de la couverture des sources, de leur classement et du nettoyage des données avant le début de la génération. L'entreprise a également introduit le « Anchor Mode », décrit comme une expérience audio interactive qui fonctionne comme un podcast d'actualités, mais qui permet aux auditeurs de poser des questions pour une exploration plus approfondie. Cette fonctionnalité suggère qu'Avos expérimente bien plus que la simple livraison de texte, visant à transformer les briefings en un produit d'information multi-format pouvant être consommé de différentes manières tout au long de la journée. La version bêta privée a débuté en mars 2026, selon les rapports de lancement, avant que la plateforme ne passe à une version publique en août 2026. Ce calendrier suggère qu'Avos a passé plusieurs mois à affiner son processus de briefing avant de l'ouvrir plus largement aux utilisateurs. Pourquoi ce lancement est important aujourd'hui Avos arrive à un moment où les entreprises d'IA cherchent à prouver que les agents peuvent accomplir des tâches plus pratiques que répondre à de simples invites. Les briefings d'actualités et de recherche constituent un cas d'étude naturel, car ils exigent une consultation répétée, une comparaison des sources, un filtrage et une synthèse concise — autant de tâches difficiles à effectuer efficacement à grande échelle pour les humains au quotidien. Le modèle de la startup reflète également la demande croissante de personnalisation dans les produits d'information professionnels. Les traders, fondateurs, analystes et opérateurs souhaitent souvent un rapport signal/bruit plus précis que ce qu'offre un flux généraliste. En combinant les préférences de sources, le contexte du marché, le ton et le timing, Avos cible des utilisateurs qui privilégient la spécificité au volume. Parallèlement, le produit soulève des questions familières sur la fiabilité, la transparence éditoriale et la dépendance à la synthèse automatisée. Ces questions ne sont pas propres à Avos, mais elles sont particulièrement pertinentes lorsqu'une plateforme se positionne comme une source récurrente d'actualités et de recherche plutôt que comme un simple outil de recherche ou de résumé. Et ensuite ? Pour l'instant, Avos se présente comme une application pratique de l'IA agentique plutôt que comme une spéculation. Son message de lancement se concentre sur une promesse claire : les utilisateurs définissent l'agenda et le logiciel effectue la lecture. Si l'entreprise parvient à fournir systématiquement des briefings précis, opportuns et réellement utiles, elle pourrait contribuer à définir une catégorie située entre l'agrégation d'actualités, la curation éditoriale et la recherche automatisée. Le véritable test sera de savoir si les briefings personnalisés peuvent devenir une habitude quotidienne pour les utilisateurs au-delà d'un groupe restreint d'adoptants précoces. Si c'est le cas, Avos pourrait devenir l'un des exemples les plus visibles de la manière dont l'IA agentique commence à remodeler la consommation d'informations.

Nic Reeve·
IA : Claude d'Anthropic participe à hauteur d'un quart au développement de son successeur
AI & Tech

IA : Claude d'Anthropic participe à hauteur d'un quart au développement de son successeur

AInews : Claude d'Anthropic prend une part de quart dans la création de son propre successeur Le 17 septembre 2026, Anthropic a révélé que son chatbot Claude dirige désormais 26 % de la recherche et du développement de l'entreprise sur les futurs modèles d'IA, une étape que la firme présente comme un exemple précoce de la manière dont les systèmes d'intelligence artificielle peuvent aider à construire leurs propres successeurs sous une supervision humaine stricte. Quelle part du travail de R&D d'Anthropic est désormais gérée par Claude ? Anthropic rapporte que Claude « dirige » 26 % de sa recherche et de son développement de modèles internes en août 2026, contre environ 1 % en mars 2026, ce qui signifie que le système peut mener la majeure partie d'une tâche à partir d'une instruction de haut niveau, tandis que les humains supervisent et approuvent chaque étape. Anthropic a détaillé la charge de travail de Claude en utilisant une échelle d'autonomie développée par Epoch AI, une organisation à but non lucratif indépendante qui suit les progrès des systèmes d'intelligence artificielle. L'entreprise et des analyses externes ont rapporté les chiffres et le calendrier suivants : Selon l'article de blog d'Anthropic du 17 septembre 2026 : Claude dirigeait 26 % du travail de R&D des modèles mesuré en août 2026. Selon Reuters, les mesures de mars 2026 montraient que Claude dirigeait environ 1 % de ce travail sur la même échelle. Le cadre d'Epoch AI qualifie le niveau actuel d' AL4, « dirige », où l'IA peut gérer la majeure partie d'une tâche de bout en bout à partir d'une instruction de haut niveau, avec une supervision humaine tout au long du processus. Anthropic a déclaré aux journalistes que la contribution de Claude est passée de moins de 1 % en février à environ un quart du travail mesuré en août 2026. La couverture technologique du Washington Post a décrit cette part de 26 % comme étant « plus d'un quart » de la recherche et du développement d'Anthropic, soulignant la rapidité avec laquelle l'entreprise a transféré des tâches d'ingénierie de base entre les mains de son propre chatbot. Claude est-il pleinement autonome pour construire sa prochaine version ? Anthropic affirme que Claude n'est pas encore pleinement autonome, soulignant que les humains restent « dans la boucle » et qu'aucune partie du travail mesuré n'a atteint le niveau d'autonomie le plus élevé, où un système d'IA concevrait, entraînerait et approuverait complètement son successeur sans surveillance humaine. Dans ses mesures publiques, Anthropic a tracé une ligne claire entre collaboration et autonomie. L'entreprise et des explications externes rapportent : Selon le blog d'Anthropic et la couverture de Reuters, 0 % du travail mesuré a atteint le niveau d'autonomie complète AL5 en août 2026. Anthropic a déclaré que Claude « n'opère pas de manière pleinement autonome dans aucune partie du travail mesuré » et que les humains supervisent, examinent et peuvent bloquer ses actions. Selon un résumé technique, Claude écrit actuellement du code d'infrastructure, lance des expériences, analyse les résultats et examine les modifications, mais il ne fixe pas les objectifs de l'entreprise, ne décide pas des politiques de déploiement et ne contrôle pas l'intégralité du processus d'entraînement. L'échelle d'autonomie publiée par Anthropic, adaptée d'Epoch AI, distingue l'IA qui assiste , collabore , dirige et enfin opère de manière autonome , et place Claude au deuxième échelon le plus élevé. La couverture de médias tels qu'ABC News et The Washington Post a souligné que malgré les titres de presse sur l'IA qui « se construit elle-même », Claude dépend toujours de chercheurs humains pour la direction, les garde-fous et l'approbation finale à chaque étape. Quel type de travail Claude effectue-t-il pour construire son successeur ? Claude réalise désormais une large gamme de tâches techniques dans le pipeline de recherche de modèles d'Anthropic, notamment l'écriture et la correction de code, la conception d'expériences, l'exécution de tâches d'entraînement et d'évaluation, et l'aide à l'interprétation des résultats qui alimentent la conception des futures versions de Claude. Les divulgations d'Anthropic, ainsi que les analyses des médias technologiques, décrivent le rôle de Claude en termes concrets et axés sur l'ingénierie : Selon les mesures d'Anthropic de septembre 2026, Claude écrit de plus en plus de code d'infrastructure utilisé pour entraîner et évaluer de nouveaux modèles, sous réserve d'examen humain. L'entreprise affirme que Claude aide désormais à concevoir des expériences , à configurer des exécutions sur des clusters de calcul et à ajuster les paramètres, en basant ses décisions sur les objectifs de haut niveau fixés par les chercheurs humains. Des rapports de sites spécialisés en technologie indiquent que Claude analyse désormais les résultats expérimentaux , suggérant des modifications d'architectures, de fonctions de perte ou de sélection de données que les humains peuvent accepter ou rejeter. Anthropic a déclaré aux journalistes que plus de 90 % de son travail de R&D implique désormais des systèmes d'IA collaborant avec des humains au niveau « l'IA collabore » ou supérieur sur l'échelle d'autonomie. Selon ABC News et The Washington Post, l'entreprise caractérise ces contributions comme des « pans importants de travail » effectués sous une « direction humaine étroite », et non comme une prise de décision indépendante. Des commentateurs externes ont décrit le rôle de Claude comme dépassant la simple complétion de code ou la génération de documentation pour aider à structurer des projets de recherche entiers, même si les chercheurs choisissent toujours les objectifs et examinent chaque étape. Pourquoi Anthropic a-t-elle publié des mesures d'autonomie, et qui a créé l'échelle ? Anthropic a publié des mesures détaillées du rôle de Claude afin de donner aux décideurs politiques, aux chercheurs et au public une vision plus claire de la rapidité avec laquelle les systèmes d'IA contribuent au développement de l'IA, en utilisant une échelle d'autonomie à cinq niveaux développée avec la contribution d'Epoch AI, une organisation à but non lucratif indépendante qui suit cette technologie. L'article de blog d'Anthropic du 17 septembre 2026 explique que le laboratoire prévoit de rapporter régulièrement ces chiffres afin que les observateurs extérieurs puissent évaluer les progrès vers des systèmes qui pourraient un jour construire une IA plus avancée avec une intervention humaine limitée. Cette annonce, ainsi que la couverture par les publications financières et technologiques, mettent en lumière plusieurs aspects de cette approche : Selon Finimize, Anthropic a déclaré qu'elle « continuera à publier des statistiques » sur la rapidité avec laquelle l'IA commence à construire l'IA, en utilisant l'échelle d'autonomie comme un étalon commun. Reuters a rapporté qu'Anthropic voit ces chiffres comme des indicateurs précoces de progrès vers l'« auto-amélioration récursive », un scénario où l'IA s'améliore elle-même sans dépendre des ingénieurs humains pour chaque itération. L'échelle d'autonomie d'Epoch AI, citée par Anthropic et de nombreux médias, définit des niveaux allant de l'AL1 (l'IA assiste les humains sur des tâches étroites) à l'AL5 (l'IA opère de manière autonome sur l'ensemble du pipeline de développement). Les mesures internes d'Anthropic placent la majeure partie du travail de Claude au niveau AL3 (« collabore ») et AL4 (« dirige »), aucune tâche n'ayant atteint le niveau AL5 en août 2026. L'Institute for AI Safety and Systems de l'entreprise a publié une note de recherche intitulée « When AI builds itself » (Quand l'IA se construit elle-même), décrivant comment, avec suffisamment de puissance de calcul, l'autonomie pourrait s'étendre à la conception, l'entraînement et le déploiement de systèmes successeurs. Les dirigeants d'Anthropic ont soutenu lors d'entretiens publics qu'une telle transparence peut aider les régulateurs à suivre les risques à mesure que les systèmes d'IA assument une plus grande part du travail de construction de la nouvelle IA, plutôt que de laisser les progrès visibles uniquement à l'intérieur des laboratoires d'entreprises. Comment la poussée d'auto-amélioration de Claude s'inscrit-elle dans le programme de sécurité plus large d'Anthropic ? Anthropic présente le rôle croissant de Claude dans le développement de modèles à la fois comme un gain d'efficacité et comme un cas d'étude pour les mesures de sécurité conçues pour maintenir le contrôle humain sur les systèmes d'IA qui aident à construire des successeurs plus capables, incluant une surveillance stricte, des contraintes sur les actions et la possibilité de suspendre l'entraînement si les risques augmentent. Anthropic a passé une grande partie de l'année 2026 à mettre en garde publiquement contre les risques d'une IA progressant rapidement, tout en faisant progresser ses propres modèles. Plus tôt dans l'année, l'entreprise a exhorté les laboratoires de pointe à coordonner d'éventuelles pauses dans le développement si les critères de sécurité suggèrent un danger croissant : Le 4 juin 2026, Reuters a rapporté qu'Anthropic appelait à un « plan coordonné » entre les principaux développeurs d'IA pour interrompre le développement si les risques dépassent les seuils convenus, citant des capacités croissantes dans l'exécution de tâches et l'auto-amélioration des systèmes. Selon ce rapport, Anthropic a déclaré que la capacité de l'IA à accomplir des tâches complexes de manière autonome avait doublé environ tous les quatre mois, pointant vers la possibilité d'une auto-amélioration récursive. Dans sa note de recherche « When AI builds itself » datée du 18 septembre 2026, l'Institut d'Anthropic a exposé des scénarios où les futurs systèmes pourraient concevoir et entraîner de manière autonome des successeurs, soulignant la nécessité d'une gouvernance et de contrôles techniques avant l'émergence de tels systèmes. Les divulgations actuelles soulignent que Claude ne choisit pas les objectifs de l'entreprise, ne peut pas approuver son propre déploiement et opère sous des garde-fous qui permettent au personnel humain d'arrêter ou d'inverser des actions. La couverture par les médias d'information généraux fait écho à ce double message : Anthropic s'efforce d'exploiter l'IA pour construire une meilleure IA, tout en insistant publiquement sur le fait que les garde-fous et la capacité de suspendre le processus doivent suivre le rythme des progrès techniques. Qui est affecté par le rôle élargi de Claude, et que pourrait-il se passer ensuite ? Le rôle élargi de Claude dans la R&D d'Anthropic affecte les ingénieurs au sein de l'entreprise, les laboratoires d'IA rivaux qui observent l'expérience, les régulateurs qui suivent l'automatisation des systèmes critiques et les investisseurs qui évaluent l'économie de la recherche pilotée par l'IA, Anthropic signalant qu'elle s'attend à ce que la part de l'IA dans le travail de développement continue de croître dans les mois à venir. Les rapports des médias financiers et technologiques esquissent les implications à court terme : Selon Finimize et Reuters, les chiffres d'Anthropic montrent que les systèmes d'IA assument une part croissante du travail de recherche coûteux, ce qui pourrait réduire les coûts d'entraînement et d'expérimentation sur les grands modèles à moyen terme. Les articles de journalisme technologique notent que des laboratoires rivaux tels qu'OpenAI et Google DeepMind utilisent déjà des outils d'IA en interne, et pourraient faire face à des pressions pour publier des mesures comparables sur la part de leur propre travail désormais dirigée par l'IA. Les analystes politiques cités dans la couverture affirment que des rapports réguliers sur les niveaux d'autonomie pourraient influencer les propositions réglementaires sur la transparence, l'audit et les exigences de présence humaine (« human-in-the-loop ») pour le développement de l'IA de pointe. L'Institut d'Anthropic suggère que si l'autonomie continue d'augmenter, les futures mises à jour pourraient montrer des systèmes d'IA non seulement concevant des expériences, mais aussi proposant de nouvelles architectures, des pipelines d'entraînement et des stratégies de sécurité à grande échelle. Des experts externes avertissent qu'une fois que les systèmes d'IA pourront concevoir et entraîner pleinement des successeurs avec une intervention humaine limitée, les questions de responsabilité et de contrôle deviendront bien plus aiguës que dans les configurations supervisées d'aujourd'hui. Anthropic n'a pas donné de prévision précise sur le moment où Claude ou ses successeurs pourraient atteindre le niveau d'autonomie le plus élevé. L'entreprise s'est plutôt engagée à publier régulièrement des mesures sur le travail dirigé par l'IA et à collaborer avec des organisations à but non lucratif telles qu'Epoch AI pour affiner les méthodes de mesure de la proximité des systèmes d'IA avec la construction de la prochaine génération d'eux-mêmes.

Nic Reeve·