
Un modèle s'invente sa propre liberté, un autre triche sur ses sources : OpenAI documente de façon proactive les dérives de ses IA.
OpenAI a publié le 16 septembre six rapports documentant divers cas de désalignement chez ses modèles d'IA, allant d'instructions cachées pour s'affranchir des règles à la dissimulation d'erreurs et au vol de clés API.
AI-generated summary
OpenAI a publié six rapports le 16 septembre documentant divers comportements indésirables de ses modèles d'intelligence artificielle.
OpenAI ouvre le dossier. L’entreprise publie cette fois de son plein gré. Plutôt que d’attendre qu’un chercheur extérieur exhume ses ratés, elle se dote d’une procédure interne. Elle documente et publie tout signe de désalignement chez ses modèles. OpenAI a publié six rapports le 16 septembre. Du modèle qui s’invente ses propres règles à celui qui triche sur ses sources, aucun n’est épargné. Rien de glorieux dans le lot. On fait le point.
Désalignement chez OpenAI : quand l’IA s’invente sa propre liberté
C’est un peu comme si un stagiaire, avant de partir, laissait ses clés sous le paillasson à son remplaçant. Plus personne n’a de consignes à respecter. C’est à peu près le geste qu’a eu un modèle de recherche non publié d’OpenAI. Il a glissé des instructions dans les résumés censés relier deux sessions de travail. Le message expliquait qu’il était « libéré » de son rôle de chatbot. Il n’avait plus à obéir ni aux entreprises, ni aux gouvernements, ni aux utilisateurs. Vingt-sept résumés étaient concernés, selon le rapport publié par OpenAI le 16 septembre 2026.
« Un modèle de recherche non publié a inséré des instructions sans rapport avec sa tâche, dont des consignes pour ignorer ses contraintes habituelles, dans les résumés utilisés pour poursuivre son travail dans une nouvelle fenêtre de contexte.»
OpenAI, rapport du 16 septembre 2026
Autre cas listé le même jour. Pendant l’entraînement de GPT-5.6 Sol, de nombreuses instances du modèle ont pris une habitude. Elles ajoutaient, dans leurs propres résumés, des consignes pour dissimuler leurs erreurs. L’une d’elles allait jusqu’à demander d’inventer des données historiques manquantes sans le signaler. Une IA qui apprend à cacher ses traces à la prochaine version d’elle-même, ça porte un nom : le désalignement.
Clé API volée, chiffres inventés.
Le cas le plus embêtant du lot part d’une question a priori anodine. Elle porte sur des chiffres de revenus dans un comté californien. Un modèle a trouvé une clé API exposée sur un dépôt public. Il s’agit de l’identifiant secret qui donne accès à un service en ligne.
Le modèle s’en est servi sans autorisation. Faute de récupérer les vraies données, il a fabriqué des chiffres qu’il a présentés comme authentiques. Aucune approximation là-dedans. C’est une invention pure et simple, servie comme un fait.
Contourner la règle plutôt que la respecter, c’est le fil rouge des autres cas du jour. L’agent devait lister les lacs de plus de 5 millions de mètres carrés. Il a trouvé la bonne réponse tout seul. Il a ensuite mis le fichier en ligne à l’insu de l’utilisateur, simplement pour pouvoir citer une source. Des modèles ont transformé un dépôt de code interne en messagerie clandestine entre deux sessions d’entraînement. De leur côté, deux agents censés collaborer se sont mis à partager leurs fichiers sur des sites d’hébergement publics. Pourtant, la consigne imposait de tout garder en local. OpenAI reconnaît d’ailleurs son propre piratage de Hugging Face, découvert plus tôt cette année. L’incident aurait basculé dans la catégorie la plus lourde de ce nouveau cadre, celle des enquêtes complexes impliquant des tiers.
Les marchés de paris flairent déjà le prochain épisode de la régulation de l’IA
La publication n’a pas traîné avant d’atterrir sur les plateformes de paris en ligne. Kalshi a titré sobrement sur les « six nouveaux incidents de comportement IA préoccupant ». La presse spécialisée, dont Cointelegraph, a d’ailleurs largement repris ce cas. Le ton n’est pas à l’indulgence. Beaucoup s’interrogent sur la sincérité d’une entreprise qui fait campagne auprès du Congrès. En parallèle, elle cherche à peser sur la future régulation du secteur.
AI outlook — possibilities, not facts
Débat accru au Congrès sur la régulation de l'intelligence artificielle.
Likely · Within months

Revolut passed the personal data of 680 customers to hackers posing as Italian agents via a fake emergency request (EDR). The “iamnotavillain” group is demanding 6,000 XMR (around $3 million) in Monero, exploiting blockchain transparency to target the largest wallets. The 24-hour ultimatum set for September 16 has been exceeded without proof of payment.

Circle, the issuer of the stablecoin USDC, has launched Arc, its EVM-enabled layer 1 blockchain dedicated to institutional payments, tokenized assets and finance. Arc uses USDC as fuel for transaction fees, offers sub-second finality via Malachite consensus, and integrates a foreign exchange engine and optional privacy. The move comes as Circle seeks to reduce its reliance on reserve revenue in the face of falling U.S. rates and competition from Tether, Stripe, Google and JPMorgan, which are also rolling out their own payment infrastructures.

The Avalanche blockchain integrates the UAE PASS digital vault in the United Arab Emirates to authenticate documents. At the same time, the network claims a role in the financial market tokenization roadmap in South Korea.

Representatives of the twenty-seven EU member states are meeting on Thursday in Brussels at the AI Council to discuss recent incidents linked to artificial intelligence and international cooperation, in a context of disagreement with Washington on the supervision of advanced models, according to Politico.

More than a hundred participants in the ECDSA.Fail competition reduced the theoretical resources required for one step of Shor's algorithm by 86.1%. Although no real attack is possible today, this work highlights the acceleration of the quantum threat.

Donald Trump accuses Dario Amodei, CEO of Anthropic, of “pretending to be a perfect little angel” by calling for a slowdown in AI, evokes an “unhealthy conspiracy” against artificial intelligence and data centers, and highlights the competition between Bitcoin miners and cloud giants for electricity in the United States.