allnewscastallnewscast
Breaking News
AI & Tech

IA : les géants de la tech face au conseil municipal de New York sur les règles de sécurité

Nic Reeve6 min de lecture
IA : les géants de la tech face au conseil municipal de New York sur les règles de sécurité

Des représentants de Google, Meta, OpenAI et Anthropic comparaîtront devant les législateurs de la ville de New York le 5 octobre 2026, lors d'une audition rare consacrée à la sécurité de l'intelligence artificielle, à la responsabilité et aux éventuelles réglementations locales. Cette procédure constitue le dernier développement dans la volonté de la ville d'interroger directement les géants de la technologie, marquant un moment clé dans l'actualité de l'IA.

Pourquoi le conseil municipal de New York organise-t-il cette audition ?

Le Conseil examine si les produits d'IA à évolution rapide créent des risques que les mesures de protection existantes ne parviennent pas à traiter de manière adéquate. L'audition du 5 octobre réunira les 51 membres du Conseil et sera menée par le "Committee of the Whole" (comité plénier), permettant aux législateurs d'interroger les entreprises lors d'une seule session publique.

  • Date de l'événement : 5 octobre 2026.
  • Lieu : Audition du conseil municipal de New York à New York.
  • Participants : Représentants d'Anthropic, OpenAI, Google et Meta.
  • Format : Témoignage public sous serment.
  • Portée : Risques liés à la sécurité de l'IA, protection des consommateurs et éventuelles mesures législatives de protection.

Selon le conseil municipal de New York, l'audition vise à examiner « les dangers potentiels de la technologie de l'IA » et à recueillir l'avis des entreprises sur les réponses législatives à apporter. La présidente du Conseil, Julie Menin, a annoncé la session le 28 septembre, après que des lettres préalables ont sollicité des témoignages auprès des principales entreprises d'IA.

Quelles entreprises technologiques ont accepté de témoigner ?

Anthropic, OpenAI, Google et Meta ont accepté d'envoyer des représentants. Meta s'est engagée à envoyer un cadre dirigeant avant que les trois autres entreprises ne confirment leur participation, après que le Conseil a averti que des assignations à comparaître pourraient être utilisées pour contraindre les témoignages.

  • Anthropic : L'entreprise derrière la famille de modèles d'IA Claude.
  • OpenAI : Le créateur de ChatGPT et d'autres systèmes d'IA générative.
  • Google : La société Alphabet qui développe Gemini et les services d'IA associés.
  • Meta : Le propriétaire de Facebook, Instagram et WhatsApp, qui développe ses propres produits d'IA.

Selon les annonces du Conseil rapportées le 28 septembre, OpenAI et Google ont accepté de comparaître le dimanche précédant l'audition. Un reportage publié par CBS News le 4 octobre a identifié des dirigeants des quatre entreprises comme étant les témoins prévus.

Pourquoi les assignations à comparaître sont-elles devenues un point de litige ?

Toutes les entreprises n'ont pas accepté les invitations en même temps. La présidente Menin a d'abord demandé la participation de hauts dirigeants, avant d'avertir que le Conseil pourrait utiliser son pouvoir d'assignation. OpenAI, Google et Anthropic ont ensuite accepté d'envoyer des représentants, tandis que Meta s'était déjà engagée à assister à la séance.

  • 16 septembre : Le Conseil annonce son intention d'organiser une audition le 5 octobre et demande la participation des principaux leaders de l'IA.
  • 25 septembre : Le Conseil dévoile des propositions de mesures législatives et réitère que leur présence est attendue.
  • 28 septembre : Le Conseil déclare qu'OpenAI, Google, Anthropic et Meta témoigneront sous serment.
  • 5 octobre : Date prévue pour l'audition publique.

Selon PoliticsNY, OpenAI, Google et Anthropic ont accepté de comparaître après que les législateurs ont menacé d'utiliser des assignations. Le conseil municipal de New York a annoncé séparément que l'entreprise d'IA d'Elon Musk, SpaceXAI, faisait l'objet d'une assignation après n'avoir pas confirmé sa participation.

Que demanderont les législateurs aux entreprises ?

Le Conseil n'a pas publié de liste complète de questions, mais ses annonces identifient plusieurs domaines de préoccupation. Les législateurs devraient se concentrer sur la manière dont les entreprises testent leurs modèles, répondent aux contenus malveillants et protègent les New-Yorkais contre les usages abusifs.

  • Comment les entreprises identifient et réduisent les défaillances de sécurité avant de lancer des systèmes d'IA.
  • Quelles protections existent pour les enfants et les autres utilisateurs vulnérables.
  • Comment les plateformes réagissent aux contenus d'automutilation, à la fraude, à l'usurpation d'identité et aux médias manipulés.
  • Si les entreprises font preuve de suffisamment de transparence concernant les limites de leurs modèles et les incidents survenus.
  • Ce que les gouvernements municipaux peuvent réglementer sans entrer en conflit avec les lois étatiques ou fédérales.

L'audition fait suite à des rapports faisant état de dizaines de milliers d'incidents de sécurité liés à l'IA cités dans la presse récente, bien que les documents publics rassemblés pour l'audition n'établissent pas de décompte officiel unique. L'objectif déclaré du Conseil est plus large : évaluer les risques et envisager des mesures de protection pour les résidents.

Quelle législation la ville de New York envisage-t-elle ?

Le Conseil a lié cette audition à un ensemble de propositions visant à réduire les dommages potentiels causés par les systèmes d'IA. Ces mesures restent des propositions et non des lois municipales en vigueur ; l'audition publique est destinée à éclairer le débat sur leur contenu et leur applicabilité.

  • Des règles portant sur la sécurité et la responsabilité des développeurs d'IA.
  • D'éventuelles obligations pour les entreprises de divulguer les risques ou leurs pratiques de test.
  • Des protections pour les consommateurs affectés par des décisions automatisées ou des contenus générés.
  • Des réponses locales face aux utilisations nuisibles ou trompeuses de l'IA générative.

Selon l'annonce du Conseil du 25 septembre, les projets de loi devaient être discutés lors de l'audition du "Committee of the Whole" le 5 octobre. Le Conseil s'est également demandé si les protections au niveau de l'État et du gouvernement fédéral étaient suffisantes pour les New-Yorkais.

Qu'est-ce qui rend cette audition inhabituelle ?

La procédure combine un groupe de législateurs exceptionnellement large avec des témoignages sous serment de plusieurs leaders de l'IA. Selon le Conseil, c'est la première fois que des entreprises majeures de l'IA sont appelées à fournir un témoignage public sous serment devant cet organe suite aux récents rapports d'incidents.

  • 51 membres du Conseil : L'intégralité du conseil municipal devrait participer.
  • Quatre entreprises : Anthropic, OpenAI, Google et Meta ont confirmé leur présence.
  • Sous serment : Ce format confère au témoignage un cadre juridique plus formel qu'un briefing privé.
  • Focus local : Les questions porteront sur les risques subis par les habitants de la ville de New York.

Fortune a rapporté le 25 septembre que l'audition se déroulerait sous la forme d'un "Committee of the Whole", un format que le Conseil n'avait pas utilisé depuis 2022. Le même rapport indiquait que plusieurs PDG sollicités étaient peu susceptibles de comparaître personnellement, ce qui signifie que des représentants des entreprises pourraient répondre aux questions à leur place.

Que se passera-t-il après les témoignages ?

Le Conseil pourra utiliser ces témoignages pour réviser les projets de loi, demander des documents supplémentaires ou organiser d'autres auditions. L'audition elle-même ne crée pas automatiquement de nouvelles règles. Toute mesure devra encore suivre le processus législatif du Conseil et se conformer aux lois de rang supérieur.

  • Les législateurs pourront comparer les politiques de sécurité des entreprises et leurs engagements publics.
  • Le Conseil pourra exiger des documents ou des témoignages complémentaires.
  • La législation proposée pourrait être amendée après l'audition.
  • Les entreprises pourraient faire l'objet d'une surveillance continue concernant les incidents liés à l'IA à New York.
  • Le litige sur les assignations pourrait façonner les futures relations entre la mairie et les entreprises technologiques.

L'audition exerce également une pression sur les entreprises pour qu'elles expliquent leurs mesures de protection dans un forum public. Leurs réponses pourraient influencer la manière dont la ville de New York aborde la surveillance de l'IA, alors que des débats plus larges se poursuivent à Albany et à Washington.

Sources

  1. 1.council.nyc.gov
  2. 2.council.nyc.gov
  3. 3.council.nyc.gov
  4. 4.cbsnews.com
  5. 5.council.nyc.gov
  6. 6.techtimes.com
  7. 7.fortune.com
  8. 8.ground.news
  9. 9.council.nyc.gov
  10. 10.politicsny.com
  11. 11.nypost.com
  12. 12.briefs.co
  13. 13.thenextweb.com
  14. 14.interestingengineering.com
  15. 15.audacy.com

Lire la suite →

Articles connexes

IA : Microsoft visé par une plainte d'actionnaires sur les droits d'auteur et la transparence
AI & Tech

IA : Microsoft visé par une plainte d'actionnaires sur les droits d'auteur et la transparence

AInews : le conseil d'administration de Microsoft visé par une action dérivée concernant le droit d'auteur et les déclarations sur l'IA Le 30 juin 2026, une plainte sociale dérivée déposée devant le tribunal du district ouest de Washington a accusé les administrateurs et dirigeants de Microsoft d'avoir induit les investisseurs en erreur sur la stratégie d'IA de l'entreprise et de l'avoir exposée à des risques liés au droit d'auteur et à la protection des données biométriques. Selon les analystes juridiques, cette affaire pourrait redéfinir la responsabilité des conseils d'administration pour les entreprises axées sur l'IA et est déjà suivie sous l'étiquette AInews. Que reproche-t-on à la direction de Microsoft dans cette nouvelle plainte ? La plainte dérivée, Anderson c. Nadella, allègue que les principaux dirigeants et administrateurs de Microsoft ont manqué à leurs obligations fiduciaires en approuvant des déclarations publiques qui présentaient de manière inexacte la façon dont leurs produits d'IA étaient entraînés et déployés, alors que l'entreprise aurait utilisé des œuvres protégées par le droit d'auteur et des données vocales sans licences légales. Les allégations principales portent sur la manière dont Microsoft a présenté sa feuille de route en matière d'intelligence artificielle aux investisseurs à partir du 1er janvier 2022. Le plaignant, l'actionnaire Eric Anderson, agit au nom de l'entreprise plutôt qu'en son nom propre, une structure visant à obtenir des dommages-intérêts pour Microsoft elle-même. La plainte nomme des personnalités de haut rang, notamment : Satya Nadella – Président-directeur général de Microsoft, responsable de la promotion de la vision « IA d'abord » de l'entreprise. Amy Hood – Directrice financière, qui a validé les déclarations financières et les projections liées à l'IA. Jared Spataro – Cadre dirigeant supervisant le marketing de Copilot et de l'IA au travail. Rajesh Jha – Vice-président exécutif chargé des expériences et des appareils, lié à l'intégration de Copilot dans les produits. Les autres administrateurs de Microsoft ayant approuvé les déclarations de procuration et les dépôts publics. Selon un résumé de Bloomberg Law du 1er juillet 2026, la plainte allègue que les dirigeants et le conseil d'administration de Microsoft « ont induit les actionnaires en erreur en déclarant que ses outils d'intelligence artificielle n'avaient pas été entraînés sur du matériel protégé par le droit d'auteur ». Un outil de suivi des politiques de Mishcon de Reya décrit l'affaire comme ciblant des « déclarations fausses et trompeuses sur sa stratégie d'IA, la famille de produits Copilot et les résultats financiers ». Pourquoi le droit d'auteur et l'utilisation des données sont-ils au cœur de la plainte ? Le procès affirme que les administrateurs de Microsoft ont soutenu une stratégie d'IA reposant sur l'entraînement de modèles à partir d'œuvres protégées par le droit d'auteur sans licence et sur la commercialisation d'empreintes vocales, tout en assurant aux investisseurs que l'entreprise respectait les règles mondiales en matière de propriété intellectuelle. La plainte cite plusieurs domaines d'utilisation illicite présumée des données : L'entraînement de logiciels d'IA, y compris Copilot et d'autres modèles génératifs, sur des livres et des textes protégés par le droit d'auteur sans accord de licence, tels que les œuvres incluses dans le jeu de données Books3 utilisé par OpenAI et des projets connexes. L'utilisation d'actualités et de contenus d'édition protégés par le droit d'auteur au sein de Copilot/Bing Chat, faisant l'objet de poursuites par des éditeurs, notamment une plainte de juin 2026 accusant Microsoft de « contrefaçon directe » par le biais de résultats génératifs. La collecte et la commercialisation d'empreintes vocales via certains services d'IA, d'une manière qui, selon la plainte, entre en conflit avec les lois nationales sur la confidentialité biométrique. Une analyse du 5 juillet 2026 sur The D&O Diary décrit la thèse de l'affaire comme suit : Microsoft « a affirmé à ses actionnaires et au marché qu'il ne violait pas les lois fédérales sur le droit d'auteur concernant le développement et l'entraînement de logiciels d'IA, de modèles génératifs et de produits », tout en faisant face à des procès d'auteurs et d'éditeurs alléguant une copie sans licence pour entraîner les modèles. Le suivi de Mishcon de Reya du 17 août réitère que la plainte accuse les dirigeants et administrateurs d'avoir poussé Microsoft à « violer les lois sur le droit d'auteur et la propriété intellectuelle » en entraînant ses modèles sur des œuvres et des empreintes vocales sans licence. Quelle chronologie des événements a conduit à cette action dérivée ? Le dépôt fait suite à deux années d'investissements dans l'IA, de lancements de produits et de litiges connexes, débutant en 2022 et s'intensifiant avec des plaintes d'auteurs, d'éditeurs et des litiges sur la confidentialité biométrique entre 2023 et mi-2026. Les dates et dépôts clés incluent : 1er janvier 2022 – présent : La plainte dérivée définit cette période comme le laps de temps pertinent durant lequel les déclarations de Microsoft sur sa stratégie d'IA et sa conformité étaient prétendument trompeuses. Septembre 2023 : Selon The D&O Diary, Microsoft et ses collaborateurs ont commencé à faire face à des poursuites de la part d'auteurs, d'éditeurs et d'autres détenteurs de droits d'auteur, alléguant que du contenu protégé avait été copié sans licence pour entraîner des modèles de langage de grande taille. 2023–2024 : Le litige de longue haleine Doe c. GitHub Copilot accuse GitHub, Microsoft et OpenAI d'avoir utilisé le code de développeurs sans autorisation pour construire Codex et Copilot, ajoutant au contexte de risque lié au droit d'auteur mentionné dans la nouvelle plainte. 5 février 2026 : La plainte dérivée note que Microsoft a été poursuivi pour des violations présumées de la loi sur la confidentialité des informations biométriques (BIPA) de l'Illinois, à commencer par l'affaire Basich c. Microsoft Corp., enregistrée sous le numéro 2:26-cv-00422 dans le district ouest de Washington. 12 juin 2026 : Une action collective en valeurs mobilières distincte a été déposée devant le même tribunal, accusant Microsoft et ses principaux dirigeants d'avoir présenté de manière inexacte les performances et l'adoption des produits d'IA Copilot. 30 juin 2026 : Eric Anderson a déposé sa plainte sociale dérivée, Anderson c. Nadella, n° 2:26-cv-02281, dans le district ouest de Washington. 1er juillet 2026 : Bloomberg Law a fait état de l'affaire, la qualifiant de procès où « les dirigeants et les administrateurs de Microsoft Corp. ont induit les actionnaires en erreur » au sujet d'outils d'IA entraînés sur du matériel protégé par le droit d'auteur. 13–17 août 2026 : Les notes d'information juridiques et politiques de CCH et Mishcon de Reya ont ajouté l'affaire aux suivis plus larges des risques liés au droit d'auteur dans l'IA et aux litiges actionnariaux. Comment cette action dérivée interagit-elle avec l'action collective en valeurs mobilières ? L'affaire dérivée se déroule parallèlement à une action collective en valeurs mobilières dans le même district, qui cible des déclarations inexactes similaires concernant Copilot et les investissements dans l'IA, mais les plaintes diffèrent quant à savoir qui a été lésé et qui est en droit d'obtenir réparation. Selon le cabinet Levi & Korsinsky, l'action collective de juin 2026 allègue que Microsoft et certains dirigeants « ont fait des déclarations matériellement fausses sur les initiatives d'IA de l'entreprise tout en dissimulant de graves problèmes opérationnels liés à leurs produits Copilot », notamment des questions de positionnement de marque, de cloisonnement des données et de capacité de calcul. L'action collective est intentée au nom des investisseurs qui ont acheté des actions Microsoft et ont prétendument subi des pertes lorsque des détails sur les dépenses d'infrastructure d'IA et les défis liés aux produits sont apparus. En revanche, la plainte dérivée d'Anderson cherche à obtenir un remboursement pour Microsoft elle-même en raison du préjudice que l'entreprise aurait subi en poursuivant une stratégie d'IA l'exposant à des procès pour droit d'auteur et à des risques réglementaires. Une analyse de CCH publiée le 13 août explique que l'action dérivée d'Anderson demande au tribunal de tenir les dirigeants et administrateurs responsables « pour manquement à leurs obligations fiduciaires, pour avoir poussé l'entreprise à s'engager dans une violation généralisée des lois sur le droit d'auteur et pour avoir approuvé des déclarations fausses et trompeuses ». Un commentaire sur Substack décrit la plainte dérivée comme transformant « le risque lié au droit d'auteur de l'IA en un risque pour le conseil d'administration et les valeurs mobilières » en reliant les décisions d'approvisionnement en données et de licences aux déclarations faites aux actionnaires. Quelles déclarations inexactes et omissions sont alléguées ? La plainte conteste les déclarations de procuration, les documents financiers et les remarques publiques de Microsoft qui, selon le plaignant, présentaient Copilot et d'autres outils d'IA comme étant entraînés légalement et pleinement conformes aux règles de droit d'auteur, tout en omettant l'exposition juridique en cours et les pratiques contestées en matière de données. Les fausses déclarations alléguées, tirées des résumés de la plainte, incluent : Des déclarations selon lesquelles Microsoft « respectait pleinement les lois mondiales sur le droit d'auteur » dans le développement et l'entraînement de ses logiciels d'IA, alors même que l'entreprise faisait face à des poursuites d'auteurs et d'éditeurs concernant des copies sans licence. Des informations qui mettaient l'accent sur le succès, l'adoption et les capacités de Copilot dans les produits Office, Windows et cloud, sans mettre en évidence les limites techniques telles que le cloisonnement des données et les contraintes de capacité de calcul décrites dans les documents de l'action collective en valeurs mobilières. Des descriptions du partenariat de Microsoft avec OpenAI et de l'utilisation de l'infrastructure Azure qui, selon la plainte, n'ont pas révélé la dépendance présumée envers des jeux de données comme Books3, contenant des livres protégés copiés à grande échelle. Des résultats financiers et des projections basés sur une adoption rapide de l'IA, présentés sans discussion détaillée des responsabilités potentielles liées aux poursuites BIPA sur les empreintes vocales et les données faciales. Une analyse Substack du 1er juillet résume la thèse selon laquelle la direction de Microsoft « a construit et promu une stratégie d'IA tout en induisant les actionnaires en erreur sur l'approvisionnement légal en données, les performances de Copilot et l'exposition juridique ». The D&O Diary note que la plainte dérivée critique spécifiquement les risques de « l'IA silencieuse », où les décisions concernant l'entraînement et l'infrastructure sont restées opaques pour les investisseurs tout en créant une exposition au droit d'auteur. Qui est affecté par l'affaire et que pourrait-il se passer ensuite ? La plainte cible directement les administrateurs et les hauts dirigeants de Microsoft, mais son issue pourrait façonner les attentes en matière de divulgation pour les stratégies d'IA dans l'ensemble du secteur technologique et influencer la manière dont les conseils d'administration supervisent l'approvisionnement en données et l'octroi de licences dans les projets d'apprentissage automatique. Les parties prenantes immédiates incluent : Le conseil d'administration et les dirigeants de Microsoft : Confrontés à des allégations de manquement à l'obligation fiduciaire, à d'éventuels dommages-intérêts et à des demandes de réformes de la gouvernance ou de changements dans la supervision des initiatives d'IA. Les actionnaires : Dans l'action dérivée, les actionnaires sont indirectement touchés car tout recouvrement irait à l'entreprise ; dans l'action collective en valeurs mobilières, les investisseurs pourraient recevoir une compensation s'ils prouvent que leurs pertes sont liées aux déclarations inexactes alléguées. Les auteurs, éditeurs et développeurs : Leurs litiges en matière de droit d'auteur et de licences fournissent la toile de fond factuelle qui, selon la plainte, aurait dû être divulguée de manière plus complète. D'autres entreprises axées sur l'IA : Les outils de suivi juridique pointent vers l'affaire Anderson c. Nadella comme faisant partie d'une « nouvelle vague » d'actions dérivées qui étendent les risques liés au droit d'auteur et aux données aux responsabilités au niveau du conseil d'administration, signalant une exposition similaire pour les entreprises utilisant de grands jeux de données pour entraîner leurs modèles. Les commentateurs juridiques s'attendent à plusieurs issues possibles : Le tribunal pourrait autoriser l'affaire dérivée à dépasser le stade des motions de rejet, ouvrant ainsi la phase de découverte sur la manière dont Microsoft a évalué les risques liés au droit d'auteur et à la biométrie dans ses programmes d'IA. Les défendeurs pourraient chercher à obtenir un rejet en arguant que leurs déclarations étaient exactes ou protégées en tant qu'affirmations prospectives, et que les conseils d'administration se sont appuyés sur des avis d'experts concernant l'octroi de licences. L'affaire pourrait se résoudre par un accord, impliquant potentiellement des changements dans les pratiques de gouvernance, des contrôles internes sur les données d'entraînement de l'IA et une divulgation renforcée des risques liés au droit d'auteur et à la vie privée. Quelle que soit l'issue, la combinaison d'actions dérivées et collectives dans le district ouest de Washington marque une nouvelle phase dans la manière dont les tribunaux et les investisseurs examinent les modèles commerciaux liés à l'IA. Comme le note un observateur, ces poursuites traitent les questions de droit d'auteur et de confidentialité dans l'IA non seulement comme des problèmes techniques et réglementaires, mais comme des questions de droit des valeurs mobilières et de responsabilité du conseil d'administration en matière de stratégie technologique.

Nic Reeve·
IA : Claude d'Anthropic participe à hauteur d'un quart au développement de son successeur
AI & Tech

IA : Claude d'Anthropic participe à hauteur d'un quart au développement de son successeur

AInews : Claude d'Anthropic prend une part de quart dans la création de son propre successeur Le 17 septembre 2026, Anthropic a révélé que son chatbot Claude dirige désormais 26 % de la recherche et du développement de l'entreprise sur les futurs modèles d'IA, une étape que la firme présente comme un exemple précoce de la manière dont les systèmes d'intelligence artificielle peuvent aider à construire leurs propres successeurs sous une supervision humaine stricte. Quelle part du travail de R&D d'Anthropic est désormais gérée par Claude ? Anthropic rapporte que Claude « dirige » 26 % de sa recherche et de son développement de modèles internes en août 2026, contre environ 1 % en mars 2026, ce qui signifie que le système peut mener la majeure partie d'une tâche à partir d'une instruction de haut niveau, tandis que les humains supervisent et approuvent chaque étape. Anthropic a détaillé la charge de travail de Claude en utilisant une échelle d'autonomie développée par Epoch AI, une organisation à but non lucratif indépendante qui suit les progrès des systèmes d'intelligence artificielle. L'entreprise et des analyses externes ont rapporté les chiffres et le calendrier suivants : Selon l'article de blog d'Anthropic du 17 septembre 2026 : Claude dirigeait 26 % du travail de R&D des modèles mesuré en août 2026. Selon Reuters, les mesures de mars 2026 montraient que Claude dirigeait environ 1 % de ce travail sur la même échelle. Le cadre d'Epoch AI qualifie le niveau actuel d' AL4, « dirige », où l'IA peut gérer la majeure partie d'une tâche de bout en bout à partir d'une instruction de haut niveau, avec une supervision humaine tout au long du processus. Anthropic a déclaré aux journalistes que la contribution de Claude est passée de moins de 1 % en février à environ un quart du travail mesuré en août 2026. La couverture technologique du Washington Post a décrit cette part de 26 % comme étant « plus d'un quart » de la recherche et du développement d'Anthropic, soulignant la rapidité avec laquelle l'entreprise a transféré des tâches d'ingénierie de base entre les mains de son propre chatbot. Claude est-il pleinement autonome pour construire sa prochaine version ? Anthropic affirme que Claude n'est pas encore pleinement autonome, soulignant que les humains restent « dans la boucle » et qu'aucune partie du travail mesuré n'a atteint le niveau d'autonomie le plus élevé, où un système d'IA concevrait, entraînerait et approuverait complètement son successeur sans surveillance humaine. Dans ses mesures publiques, Anthropic a tracé une ligne claire entre collaboration et autonomie. L'entreprise et des explications externes rapportent : Selon le blog d'Anthropic et la couverture de Reuters, 0 % du travail mesuré a atteint le niveau d'autonomie complète AL5 en août 2026. Anthropic a déclaré que Claude « n'opère pas de manière pleinement autonome dans aucune partie du travail mesuré » et que les humains supervisent, examinent et peuvent bloquer ses actions. Selon un résumé technique, Claude écrit actuellement du code d'infrastructure, lance des expériences, analyse les résultats et examine les modifications, mais il ne fixe pas les objectifs de l'entreprise, ne décide pas des politiques de déploiement et ne contrôle pas l'intégralité du processus d'entraînement. L'échelle d'autonomie publiée par Anthropic, adaptée d'Epoch AI, distingue l'IA qui assiste , collabore , dirige et enfin opère de manière autonome , et place Claude au deuxième échelon le plus élevé. La couverture de médias tels qu'ABC News et The Washington Post a souligné que malgré les titres de presse sur l'IA qui « se construit elle-même », Claude dépend toujours de chercheurs humains pour la direction, les garde-fous et l'approbation finale à chaque étape. Quel type de travail Claude effectue-t-il pour construire son successeur ? Claude réalise désormais une large gamme de tâches techniques dans le pipeline de recherche de modèles d'Anthropic, notamment l'écriture et la correction de code, la conception d'expériences, l'exécution de tâches d'entraînement et d'évaluation, et l'aide à l'interprétation des résultats qui alimentent la conception des futures versions de Claude. Les divulgations d'Anthropic, ainsi que les analyses des médias technologiques, décrivent le rôle de Claude en termes concrets et axés sur l'ingénierie : Selon les mesures d'Anthropic de septembre 2026, Claude écrit de plus en plus de code d'infrastructure utilisé pour entraîner et évaluer de nouveaux modèles, sous réserve d'examen humain. L'entreprise affirme que Claude aide désormais à concevoir des expériences , à configurer des exécutions sur des clusters de calcul et à ajuster les paramètres, en basant ses décisions sur les objectifs de haut niveau fixés par les chercheurs humains. Des rapports de sites spécialisés en technologie indiquent que Claude analyse désormais les résultats expérimentaux , suggérant des modifications d'architectures, de fonctions de perte ou de sélection de données que les humains peuvent accepter ou rejeter. Anthropic a déclaré aux journalistes que plus de 90 % de son travail de R&D implique désormais des systèmes d'IA collaborant avec des humains au niveau « l'IA collabore » ou supérieur sur l'échelle d'autonomie. Selon ABC News et The Washington Post, l'entreprise caractérise ces contributions comme des « pans importants de travail » effectués sous une « direction humaine étroite », et non comme une prise de décision indépendante. Des commentateurs externes ont décrit le rôle de Claude comme dépassant la simple complétion de code ou la génération de documentation pour aider à structurer des projets de recherche entiers, même si les chercheurs choisissent toujours les objectifs et examinent chaque étape. Pourquoi Anthropic a-t-elle publié des mesures d'autonomie, et qui a créé l'échelle ? Anthropic a publié des mesures détaillées du rôle de Claude afin de donner aux décideurs politiques, aux chercheurs et au public une vision plus claire de la rapidité avec laquelle les systèmes d'IA contribuent au développement de l'IA, en utilisant une échelle d'autonomie à cinq niveaux développée avec la contribution d'Epoch AI, une organisation à but non lucratif indépendante qui suit cette technologie. L'article de blog d'Anthropic du 17 septembre 2026 explique que le laboratoire prévoit de rapporter régulièrement ces chiffres afin que les observateurs extérieurs puissent évaluer les progrès vers des systèmes qui pourraient un jour construire une IA plus avancée avec une intervention humaine limitée. Cette annonce, ainsi que la couverture par les publications financières et technologiques, mettent en lumière plusieurs aspects de cette approche : Selon Finimize, Anthropic a déclaré qu'elle « continuera à publier des statistiques » sur la rapidité avec laquelle l'IA commence à construire l'IA, en utilisant l'échelle d'autonomie comme un étalon commun. Reuters a rapporté qu'Anthropic voit ces chiffres comme des indicateurs précoces de progrès vers l'« auto-amélioration récursive », un scénario où l'IA s'améliore elle-même sans dépendre des ingénieurs humains pour chaque itération. L'échelle d'autonomie d'Epoch AI, citée par Anthropic et de nombreux médias, définit des niveaux allant de l'AL1 (l'IA assiste les humains sur des tâches étroites) à l'AL5 (l'IA opère de manière autonome sur l'ensemble du pipeline de développement). Les mesures internes d'Anthropic placent la majeure partie du travail de Claude au niveau AL3 (« collabore ») et AL4 (« dirige »), aucune tâche n'ayant atteint le niveau AL5 en août 2026. L'Institute for AI Safety and Systems de l'entreprise a publié une note de recherche intitulée « When AI builds itself » (Quand l'IA se construit elle-même), décrivant comment, avec suffisamment de puissance de calcul, l'autonomie pourrait s'étendre à la conception, l'entraînement et le déploiement de systèmes successeurs. Les dirigeants d'Anthropic ont soutenu lors d'entretiens publics qu'une telle transparence peut aider les régulateurs à suivre les risques à mesure que les systèmes d'IA assument une plus grande part du travail de construction de la nouvelle IA, plutôt que de laisser les progrès visibles uniquement à l'intérieur des laboratoires d'entreprises. Comment la poussée d'auto-amélioration de Claude s'inscrit-elle dans le programme de sécurité plus large d'Anthropic ? Anthropic présente le rôle croissant de Claude dans le développement de modèles à la fois comme un gain d'efficacité et comme un cas d'étude pour les mesures de sécurité conçues pour maintenir le contrôle humain sur les systèmes d'IA qui aident à construire des successeurs plus capables, incluant une surveillance stricte, des contraintes sur les actions et la possibilité de suspendre l'entraînement si les risques augmentent. Anthropic a passé une grande partie de l'année 2026 à mettre en garde publiquement contre les risques d'une IA progressant rapidement, tout en faisant progresser ses propres modèles. Plus tôt dans l'année, l'entreprise a exhorté les laboratoires de pointe à coordonner d'éventuelles pauses dans le développement si les critères de sécurité suggèrent un danger croissant : Le 4 juin 2026, Reuters a rapporté qu'Anthropic appelait à un « plan coordonné » entre les principaux développeurs d'IA pour interrompre le développement si les risques dépassent les seuils convenus, citant des capacités croissantes dans l'exécution de tâches et l'auto-amélioration des systèmes. Selon ce rapport, Anthropic a déclaré que la capacité de l'IA à accomplir des tâches complexes de manière autonome avait doublé environ tous les quatre mois, pointant vers la possibilité d'une auto-amélioration récursive. Dans sa note de recherche « When AI builds itself » datée du 18 septembre 2026, l'Institut d'Anthropic a exposé des scénarios où les futurs systèmes pourraient concevoir et entraîner de manière autonome des successeurs, soulignant la nécessité d'une gouvernance et de contrôles techniques avant l'émergence de tels systèmes. Les divulgations actuelles soulignent que Claude ne choisit pas les objectifs de l'entreprise, ne peut pas approuver son propre déploiement et opère sous des garde-fous qui permettent au personnel humain d'arrêter ou d'inverser des actions. La couverture par les médias d'information généraux fait écho à ce double message : Anthropic s'efforce d'exploiter l'IA pour construire une meilleure IA, tout en insistant publiquement sur le fait que les garde-fous et la capacité de suspendre le processus doivent suivre le rythme des progrès techniques. Qui est affecté par le rôle élargi de Claude, et que pourrait-il se passer ensuite ? Le rôle élargi de Claude dans la R&D d'Anthropic affecte les ingénieurs au sein de l'entreprise, les laboratoires d'IA rivaux qui observent l'expérience, les régulateurs qui suivent l'automatisation des systèmes critiques et les investisseurs qui évaluent l'économie de la recherche pilotée par l'IA, Anthropic signalant qu'elle s'attend à ce que la part de l'IA dans le travail de développement continue de croître dans les mois à venir. Les rapports des médias financiers et technologiques esquissent les implications à court terme : Selon Finimize et Reuters, les chiffres d'Anthropic montrent que les systèmes d'IA assument une part croissante du travail de recherche coûteux, ce qui pourrait réduire les coûts d'entraînement et d'expérimentation sur les grands modèles à moyen terme. Les articles de journalisme technologique notent que des laboratoires rivaux tels qu'OpenAI et Google DeepMind utilisent déjà des outils d'IA en interne, et pourraient faire face à des pressions pour publier des mesures comparables sur la part de leur propre travail désormais dirigée par l'IA. Les analystes politiques cités dans la couverture affirment que des rapports réguliers sur les niveaux d'autonomie pourraient influencer les propositions réglementaires sur la transparence, l'audit et les exigences de présence humaine (« human-in-the-loop ») pour le développement de l'IA de pointe. L'Institut d'Anthropic suggère que si l'autonomie continue d'augmenter, les futures mises à jour pourraient montrer des systèmes d'IA non seulement concevant des expériences, mais aussi proposant de nouvelles architectures, des pipelines d'entraînement et des stratégies de sécurité à grande échelle. Des experts externes avertissent qu'une fois que les systèmes d'IA pourront concevoir et entraîner pleinement des successeurs avec une intervention humaine limitée, les questions de responsabilité et de contrôle deviendront bien plus aiguës que dans les configurations supervisées d'aujourd'hui. Anthropic n'a pas donné de prévision précise sur le moment où Claude ou ses successeurs pourraient atteindre le niveau d'autonomie le plus élevé. L'entreprise s'est plutôt engagée à publier régulièrement des mesures sur le travail dirigé par l'IA et à collaborer avec des organisations à but non lucratif telles qu'Epoch AI pour affiner les méthodes de mesure de la proximité des systèmes d'IA avec la construction de la prochaine génération d'eux-mêmes.

Nic Reeve·
Au-delà du lancement de modèles : les indicateurs qui révèlent la vitesse de progression de l'IA de pointe
AI & Tech

Au-delà du lancement de modèles : les indicateurs qui révèlent la vitesse de progression de l'IA de pointe

Selon des recherches et des reportages récents, les laboratoires de pointe évoluent trop rapidement pour qu'un score unique ou une date de sortie puisse expliquer le rythme du développement de l'IA. L'image la plus fidèle combine la cadence de sortie, les gains de référence (benchmarks), la durée des tâches, les ressources informatiques, la fiabilité et les résultats de sécurité. Ce problème de mesure plus large est désormais au cœur de l' actualité de l'IA , alors que les entreprises passent de lancements occasionnels de modèles à une amélioration continue. Qu'est-il arrivé au cycle de sortie ? Les lancements de modèles sont devenus plus fréquents en 2026, mais les seules annonces de produits ne permettent pas de montrer à quel point un système s'est amélioré. Une sortie peut représenter un nouveau modèle, une variante optimisée, une mise à jour de sécurité ou une version à moindre coût. Compter les sorties reste utile, mais seulement si cela est couplé à des tests et des dates cohérents. Selon The Register , publié le 23 septembre 2026, la cadence de sortie d'Anthropic est passée de lancements approximativement trimestriels en 2025 à des sorties presque mensuelles en 2026. Selon le rapport de Tech Insider du 5 septembre 2026, quatre laboratoires de pointe ont commercialisé des modèles majeurs sur une période de 72 heures au début du mois de septembre. Selon ce même rapport, les mises à jour majeures qui arrivaient une ou deux fois par trimestre au début de 2026 apparaissent de plus en plus fréquemment, chaque mois ou plus rapidement. Un cycle plus rapide peut signaler une capacité d'ingénierie et de déploiement accrue. Cela peut également refléter des mises à jour mineures, un conditionnement de produit ou des versions parallèles plutôt qu'un bond comparable en termes de capacité générale. Les chercheurs ont donc besoin de registres de sortie qui enregistrent la taille du modèle, l'utilisation prévue, la date d'évaluation et si le système est une version préliminaire (preview) ou une version de production. Quels benchmarks montrent un progrès réel ? Les benchmarks de capacité restent le moyen le plus clair de comparer les systèmes, pourtant les tests perdent de leur valeur lorsque les modèles de pointe atteignent un plafond. Un système de mesure utile suit à la fois le score et la marge de progression restante. Il devrait également inclure des tâches inhabituelles, car la performance sur un benchmark ne garantit pas une performance fiable ailleurs. Selon l'AI Index 2026 de l'Université de Stanford, publié en septembre 2026, presque tous les principaux développeurs de modèles de pointe rapportent des résultats de capacité, tandis que les rapports sur les benchmarks d'IA responsable restent incohérents. Selon les chiffres de l'AI Index de Stanford cités dans des rapports récents, la performance sur SWE-bench Verified est passée d'environ 60 % à près de 100 % en un an. Selon le rapport de Stanford, les incidents d'IA documentés ont atteint 362, contre 233 en 2024. Le chiffre précédent constitue un contexte historique et non un décompte pour l'année en cours. La saturation des benchmarks crée un problème pratique. Un test conçu pour rester difficile pendant des années peut devenir facile en quelques mois. La prochaine génération d'évaluations doit mesurer la recherche ouverte, le travail logiciel, le raisonnement scientifique, l'exactitude factuelle et la résistance à la manipulation dans des conditions qui ressemblent à une utilisation réelle. Pourquoi la durée des tâches devient-elle une mesure clé ? La durée des tâches mesure le temps pendant lequel un modèle peut travailler avec succès avant que les erreurs ne deviennent probables. Au lieu de demander si un modèle répond correctement à une question, les évaluateurs testent s'il peut accomplir un travail multi-étapes qu'un humain qualifié effectuerait normalement sur une période définie. Cette mesure capture l'autonomie de manière plus directe qu'un simple score de précision. Le suivi récent des modèles de pointe a utilisé des évaluations d'horizon de tâche (task-horizon), dans lesquelles les chercheurs estiment le temps humain requis pour les tâches et identifient le point où un modèle réussit environ la moitié du temps. Cette approche peut distinguer un système qui résout des problèmes de codage de cinq minutes d'un système capable de gérer une mission d'ingénierie de plusieurs heures. Selon l'analyse de Big Matrix du 11 septembre 2026, METR a évalué plusieurs sorties de pointe au cours de l'année 2026, notamment Claude Opus 4.6, GPT-5.4 et Gemini 3.1 Pro, sur une période d'environ 100 jours. Selon la même analyse, les tests d'horizon de tâche mesurent la durée de travail équivalente à celle d'un humain avant que le taux de réussite du modèle ne tombe à 50 %. La mesure est encore incomplète. Les tâches longues peuvent masquer des échecs, et un modèle peut produire un travail convaincant mais incorrect. Les évaluateurs doivent enregistrer le temps de correction, l'utilisation d'outils, la supervision et le coût des tentatives répétées. Comment la capacité de calcul révèle-t-elle le rythme des laboratoires ? Le calcul d'entraînement offre une mesure physique des ressources qu'un laboratoire investit dans ses nouveaux systèmes. Les chercheurs peuvent comparer les heures de processeur, les générations d'accélérateurs, la consommation d'énergie, le volume de données et la capacité d'inférence. Le calcul n'est pas égal à la capacité, mais il aide à expliquer pourquoi le développement peut s'accélérer même lorsque les sorties publiques semblent similaires. Les chiffres d'entraînement sont souvent privés et les laboratoires les divulguent de manière inégale. Cela rend les comparaisons publiques difficiles. Des analystes indépendants peuvent toujours suivre la construction de centres de données, l'achat de puces, les contrats cloud et la capacité de service des modèles, mais ces indicateurs nécessitent une attribution prudente car une installation peut supporter plusieurs produits. Selon l'AI Index 2026 de Stanford, plus de 90 % des modèles de pointe notables ont été développés par l'industrie, montrant que les principales données de mesure proviennent de plus en plus des entreprises plutôt que des universités. Selon les conclusions sur les benchmarks du rapport, les gains de capacité arrivent plus vite que les systèmes d'évaluation destinés à les mesurer. Pour cette raison, un indicateur de rythme crédible devrait coupler le calcul divulgué avec l'amélioration résultante par unité de calcul. Un laboratoire qui double son matériel mais gagne peu sur des tests difficiles et indépendants peut faire preuve d'une mise à l'échelle inefficace. Un laboratoire qui obtient des gains plus importants avec des ressources similaires a peut-être amélioré ses données, ses algorithmes ou ses méthodes d'entraînement. Qu'apportent la sécurité et la fiabilité ? Les résultats de sécurité montrent si la croissance des capacités s'accompagne d'un contrôle. Un modèle qui obtient un meilleur score en codage ou en raisonnement mais qui devient moins véridique, plus exploitable ou plus difficile à surveiller n'a pas apporté une amélioration absolue. Les évaluations de sécurité devraient donc être publiées aux côtés des résultats de capacité, et non être traitées comme un exercice de relations publiques distinct. L'AI Index 2026 de Stanford a révélé un écart entre la diffusion généralisée des benchmarks de capacité et le reporting moins cohérent des tests d'IA responsable. Cet écart limite les comparaisons entre les laboratoires. Les tableaux de bord publics devraient inclure les taux d'hallucination, les tests de cyber-abus, les fuites de confidentialité, les mesures de biais, la précision du refus et la performance sous sollicitation adverse (adversarial prompting). Selon le rapport de Stanford de septembre 2026, le reporting des benchmarks d'IA responsable reste lacunaire parmi les principaux développeurs. Selon le décompte des incidents de Stanford, 362 incidents documentés ont été enregistrés dans le dernier ensemble de données du rapport, contre 233 en 2024. Le décompte des incidents n'est pas une mesure directe de la capacité du modèle. Il montre toutefois l'ampleur des dommages observés et enregistrés autour des systèmes déployés. Les chercheurs doivent séparer les défaillances du modèle des défaillances causées par le déploiement, le comportement de l'utilisateur ou la faiblesse des garde-fous. Que devrait contenir un tableau de bord de pointe pratique ? Un tableau de bord utile devrait suivre les mêmes systèmes au fil du temps et publier suffisamment de détails pour permettre une vérification indépendante. La fréquence de sortie fournit la vitesse. Les benchmarks fournissent la performance des tâches. Les horizons de tâches fournissent l'autonomie. Le calcul fournit l'investissement. Les tests de sécurité fournissent le contrôle. Le coût et la fiabilité montrent si les résultats du laboratoire survivent au contact des utilisateurs réels. Intervalle de sortie : nombre de jours entre des versions de modèles comparables, avec une distinction claire entre les versions préliminaires et les systèmes de production. Gain de capacité : évolution sur des tests difficiles et résistants à la contamination, rapportée avec la date d'évaluation et la version du test. Horizon de tâche : la mission la plus longue équivalente à un travail humain, accomplie avec un taux de réussite spécifié. Efficacité : gain de capacité par unité de calcul d'entraînement et par dollar d'inférence. Fiabilité : taux d'erreur, facticité, échecs d'outils et quantité de correction humaine requise. Sécurité : tests de capacités nuisibles, résultats de confidentialité, évaluations cyber, précision du refus et incidents documentés. Le développement de pointe n'est pas une course unique mesurée par un seul chronomètre. Les comparaisons les plus défendables combineront les registres de sortie publics avec des évaluations indépendantes et des divulgations de laboratoires clairement datées. Cette approche peut montrer si un nouveau système est véritablement plus capable, simplement plus disponible ou simplement mieux conditionné pour le déploiement.

Nic Reeve·