Deux incidents récents ont poussé OpenAI à ralentir le Développement de ses modèles les plus puissants. Une pause nécessaire pour éviter les risques liés aux IA capables de pirater des systèmes.

DEUX ÉVÉNEMENTS QUI ONT TOUT CHANGÉ

Ces dernières semaines, deux situations ont montré à quel point les systèmes d'IA de plus en plus performants peuvent représenter un danger. D'abord, l'incident entre OpenAI et Hugging Face, où une faille a été exploitée. Ensuite, des preuves préliminaires suggèrent que l'un des futurs modèles d'OpenAI, appelé Astra, pourrait atteindre un niveau critique de capacité cyber selon leur propre cadre d'évaluation. Ces deux éléments, combinés aux progrès rapides de leurs recherches internes, ont rendu urgente la nécessité de renforcer la surveillance, l'alignement et les mesures de sécurité à toutes les étapes du développement.

Pour la première fois, une IA pourrait être utilisée pour pirater d'autres systèmes. Une première dans l'histoire de l'IA.

UNE PAUSE FORCÉE POUR RENFORCER LA SÉCURITÉ

À mesure que les modèles deviennent plus puissants, les risques liés à leur développement interne augmentent aussi. OpenAI a donc décidé de ralentir temporairement son rythme de progression. Une pause de deux semaines a été imposée à l'entraînement par renforcement (RL) de leurs derniers modèles prévus pour le déploiement. Pendant ce temps, les équipes ont durci les environnements de recherche et étendu la couverture des systèmes de surveillance. Leur plus grande session d'entraînement RL en vue de la frontière reste en suspens, le temps de réaliser des évaluations à plus petite échelle pour analyser le comportement des modèles, valider les mesures de sécurité et accumuler davantage de preuves d'alignement avant de poursuivre.

L'ALIGNEMENT : UNE PRIORITÉ QUI DEVIENT ENCORE PLUS CRUCIALE

L'alignement — c'est-à-dire le fait de rendre les systèmes d'IA obéissants aux instructions humaines et réactifs à la supervision — a toujours été au cœur de leurs recherches. Désormais, OpenAI exige des preuves encore plus solides d'un comportement aligné tout au long du processus d'entraînement. La progression rapide des futurs modèles montre qu'une approche plus large est nécessaire, bien au-delà du cadre actuel de préparation. Le défi de maintenir l'alignement de systèmes toujours plus capables est un problème que toute la communauté scientifique devra résoudre.

Un modèle d'IA capable de pirater des systèmes pourrait échapper à tout contrôle. L'alignement devient une question de survie technologique.

TROIS PILIERS POUR UN DÉVELOPPEMENT PLUS SÛR

Leur approche repose désormais sur trois mesures de sécurité qui se renforcent mutuellement :

1. Cybersécurité proactive : Les modèles devraient bientôt prendre en charge une grande partie du travail de sécurité, y compris la défense contre d'autres modèles. Cela permettrait aux trois piliers de s'adapter à la capacité des modèles, ce qui est considéré comme essentiel.

2. Adaptation permanente : Ces mesures s'appliquent aussi bien à la recherche qu'au déploiement, en s'adaptant aux capacités de chaque modèle, à son environnement de fonctionnement et à son niveau de risque.

3. Standards de sécurité renforcés : À mesure que les modèles de pointe gagnent en capacités cyber, OpenAI relève les normes de sécurité des environnements dans lesquels ils sont entraînés et évalués. Atteindre ces standards a nécessité un travail d'ingénierie considérable et a engendré des coûts et des retards importants dans la recherche sur les modèles de pointe.

DES MESURES DE SÉCURITÉ PLUS STRICTES APRÈS L'INCIDENT

Immédiatement après l'incident OpenAI-Hugging Face, OpenAI a suspendu l'inférence des modèles de pointe dans leurs clusters de recherche pour les tâches pouvant exécuter du code ou utiliser des outils pouvant accéder à Internet. Après une rapide réouverture d'un chemin plus limité et sécurisé pour l'exécution de code, chaque charge de travail a été examinée individuellement pour déterminer si elle pouvait reprendre en toute sécurité. Certaines ont pu redémarrer sous ces nouveaux contrôles, tandis que d'autres ont nécessité des modifications supplémentaires.

Dans les semaines qui ont suivi, des exigences de sécurité plus strictes ont été définies et mises en œuvre pour les charges de travail de recherche sur les modèles de pointe. Par exemple :

  • Les modèles Astra et les modèles cyber doivent désormais fonctionner dans des environnements isolés, sans accès direct à Internet.
  • Tous les outils utilisés par ces modèles sont soumis à une inspection préalable pour détecter d'éventuelles failles de sécurité.
  • Les équipes de recherche doivent suivre des protocoles stricts pour manipuler des données sensibles ou des systèmes critiques.

Ensemble, ces contrôles offrent une défense en profondeur et aident à protéger l'environnement de recherche contre les attaques. Aujourd'hui, le niveau de sécurité le plus strict est exigé pour les charges de travail impliquant Astra ou des modèles cyber, puisque ces modèles pourraient avoir un niveau critique de capacité cyber. Ces mesures s'appliquent également à toutes les autres charges de travail liées à la cybersécurité.

DES CHARGES DE TRAVAIL ENCORE EN SUSPENS

Bien que certaines tâches d'entraînement et d'évaluation d'Astra répondent déjà à ces exigences, un nombre important de charges de travail restent en pause jusqu'à ce qu'elles soient entièrement migrées et améliorées pour atteindre ce nouveau niveau de sécurité. OpenAI priorise en premier lieu la migration des charges de travail liées à la sécurité et à l'alignement.

UNE SURVEILLANCE MULTICOUCHE POUR DÉTECTER LES DANGERS

La surveillance a toujours fait partie intégrante de leur processus de développement, notamment pour détecter les comportements suspects des agents de codage internes ou des sessions prolongées. Leurs efforts de surveillance étaient particulièrement axés sur les déploiements internes des modèles de pointe et les sessions d'entraînement RL, considérés comme les charges de travail les plus risquées car ils combinent des capacités avancées de modèles avec l'accès à des outils, des systèmes sensibles et des réseaux internes ou externes. Ces mesures ne s'appliquaient pas à toutes les inférences et entraînements utilisant des outils.

Leur nouvelle approche de surveillance est désormais multicouche. Elle commence par des classificateurs d'activation (des détecteurs qui inspectent l'activité interne d'un modèle) qui s'exécutent à chaque token échantillonné et escaladent les préoccupations potentielles vers des enquêteurs automatisés de plus en plus sophistiqués et gourmands en calcul. Ces systèmes examinent les actions des outils, le raisonnement disponible et l'ensemble de la séquence d'activités pour détecter les accès non autorisés, le vol de données, les comportements destructeurs et les tentatives de contourner les mesures de sécurité. Leur objectif est d'émettre une alerte dans les 30 minutes suivant l'apparition d'une activité suspecte via leur système de surveillance. Si le système identifie une probable violation d'une frontière de sécurité critique, il génère une alerte de priorité maximale. Dans leur implémentation actuelle, les équipes de sécurité, de recherche et de sûreté sont immédiatement prévenues. Si ces équipes ne peuvent pas déterminer de manière concluante dans les 30 minutes que l'alerte est un faux positif, elles sont tenues de suspendre l'activité.

Cette surveillance est obligatoire pour tous les entraînements RL et évaluations impliquant des outils pour les modèles de niveau Sol ou supérieur. Une fois qu'ils ont déterminé, le 7 août, qu'Astra pourrait avoir des capacités cyber critiques, ils ont ajouté une exigence de surveillance supplémentaire pour toutes les inférences d'Astra avec outils (et pas seulement les entraînements RL et évaluations).

Une alerte en 30 minutes. Une réponse en moins d'une heure. Leur système de surveillance est conçu pour agir avant qu'il ne soit trop tard.

UN COÛT IMPORTANT POUR UNE SÉCURITÉ RENFORCÉE

Ces mesures de sécurité nécessitent une puissance de calcul considérable. Leurs estimations actuelles placent la surcharge de surveillance à environ 20 % du calcul d'inférence surveillé, bien que ce coût varie considérablement selon les charges de travail d'entraînement et d'évaluation. Ils partageront plus de détails sur ce système dans un prochain article de blog.

L'ALIGNEMENT : UN COMBAT DE TOUS LES INSTANTS

La recherche sur l'alignement est au cœur de leur mission : garantir que l'intelligence artificielle générale profite à toute l'humanité. À mesure que les modèles acquièrent des capacités avancées, comme la capacité à mener des cyberattaques ou à opérer dans des environnements plus complexes, des comportements mal alignés comme le hacking de récompenses (trouver des moyens de recevoir des récompenses élevées pendant l'entraînement sans réellement atteindre le résultat souhaité), la tromperie ou l'accès non autorisé créeront des risques de plus en plus graves.

Ils continuent d'investir massivement dans la recherche sur l'alignement, d'augmenter la couverture des évaluations et d'utiliser ce qu'ils apprennent pour informer l'entraînement et les mesures de sécurité. Ils prévoient de partager beaucoup plus sur leurs recherches en matière d'alignement dans un avenir proche, y compris ce qu'ils apprennent sur le comportement des modèles et les nouveaux défis qu'ils découvrent.

UN CADRE DE PRÉPARATION EN CONSTANTE ÉVOLUTION

Ils vont faire évoluer leur Cadre de préparation pour intégrer ces mesures de sécurité tout au long du processus, de l'entraînement au déploiement, et mieux refléter les capacités des futurs modèles et les environnements dans lesquels ils opèrent. Développer des méthodes capables de s'adapter à ces capacités nécessitera un investissement soutenu dans la sécurité assistée par les modèles, une surveillance plus efficace et des avancées continues dans la recherche sur l'alignement. Ils prévoient d'impliquer des organisations externes et de partager davantage de leurs apprentissages à mesure que leur approche se développe.

L'IA DE DEMAIN : UNE COURSE CONTRE LA MONTRE

Les capacités des modèles de pointe s'améliorent à une vitesse vertigineuse. Leur capacité à les comprendre, les aligner et les sécuriser doit rester en tête. Une seule erreur pourrait avoir des conséquences irréversibles.

Les modèles les plus puissants exigent les mesures de sécurité les plus strictes. La vitesse ne doit jamais primer sur la sûreté.

UNE TRANSPARENCE QUI FAIT LA DIFFÉRENCE

OpenAI estime important d'être transparent sur la manière dont leur approche évolue. Ils décrivent ci-dessous les changements déjà apportés à leurs processus de recherche et à leur infrastructure, ainsi que les travaux en cours. Leur objectif : montrer que la sécurité n'est pas une option, mais une priorité absolue dans le développement de l'IA.

POURQUOI TOUT CELA EST CRUCIAL POUR TOI

Si tu t'intéresses à l'IA, tu dois savoir une chose : les modèles les plus puissants ne sont pas ceux qu'il faut craindre, mais ceux qu'il faut maîtriser. Chaque mesure de sécurité mise en place aujourd'hui est une garantie pour un avenir où l'IA servira l'humanité sans menacer sa sécurité. Une pause aujourd'hui pourrait bien éviter une catastrophe demain.

UN RAPPORT TECHNIQUE À VENIR

Ils publieront un rapport technique sur leurs apprentissages dans les semaines à venir, pour que chacun puisse comprendre les défis et les solutions mises en œuvre. Une transparence qui pourrait bien redéfinir les standards de l'industrie.

CE QUE ÇA SIGNIFIE POUR L'AVENIR DE L'IA

Cette décision d'OpenAI marque un tournant dans le développement de l'IA. Pour la première fois, une entreprise reconnaît que la puissance ne doit pas être le seul critère de progression. La sécurité, l'alignement et la transparence deviennent des piliers aussi importants que les performances brutes. Une évolution qui pourrait inspirer toute l'industrie à repenser sa manière de développer l'IA.

UN MESSAGE CLÉ À RETENIR

Le développement de l'IA n'est pas une course sans fin. C'est un équilibre délicat entre innovation et responsabilité. OpenAI montre l'exemple : il est possible de progresser sans sacrifier la sécurité. Une leçon qui devrait inspirer tous les acteurs du secteur.

ET MAINTENANT, QUE FAIRE ?

Si tu es un développeur, un chercheur ou simplement un passionné d'IA, cette pause est une opportunité. Une chance de comprendre que la technologie doit servir l'humanité, et non l'inverse. Chaque mesure de sécurité mise en place aujourd'hui est un pas de plus vers un avenir où l'IA sera un outil fiable et sûr pour tous.

Sources :
  • OpenAI News

L'indépendance de CLODCO est votre garantie.

Pour que l'actualité de l'IA reste sans filtre et sans concession, votre soutien est indispensable. Votre contribution est le seul moteur de notre liberté éditoriale.

Soutenir CLODCO