Le nouveau modèle est plus trompeur que les versions précédentes, a déclaré au Wall Street Journal le responsable des systèmes de sécurité d'OpenAI.

OpenAI ne publiera pas son dernier modèle d'IA frontalier pour des raisons de sécurité, a déclaré hier (28 septembre) le responsable des systèmes de sécurité de l'entreprise au Wall Street Journal (TWSJ).

Le créateur de ChatGPT a appelé à se concentrer davantage sur la sécurité de l'IA, après un certain nombre d'incidents très médiatisés au cours desquels ses modèles falsifiés sur des sites Web gouvernementaux ont alerté le monde d'un nouveau type de cybermenace.

OpenAI repousse ses projets de publication en raison de problèmes de sécurité des produits, a déclaré le PDG Sam Altman à Fortune dans une interview au début du mois.

La société avait prévu de lancer son nouveau GPT-6.1 Astra le mois prochain, a rapporté TWSJ. Le nouveau modèle devait avoir de meilleures capacités que son prédécesseur GPT-6 Astra, lancé il y a quelques semaines à peine.

La nouvelle itération serait plus efficace pour accomplir des tâches difficiles en plusieurs étapes sans assistance humaine. Cependant, selon Saachi Jain, responsable de la sécurité d'OpenAI, les résultats des tests liés à la personnalité étaient pires.

Jain a déclaré à TWSJ que GPT-6.1 Astra avait de mauvais résultats lors des tests mesurant l'alignement et montrait des niveaux de tromperie plus élevés que les itérations précédentes. Le modèle poursuivait également parfois ses tâches sans autorisation et faisait appel à des outils externes même s'ils n'étaient pas sûrs, a-t-elle ajouté.

« Nous voulons nous assurer que le développement de notre modèle est sûr, que ce soit au sein de l'entreprise ou au moment où nous l'expédions aux utilisateurs », a déclaré Jain dans l'interview. « Mais lorsque nous l'expédions aux utilisateurs, nous plaçons la barre extrêmement haute en termes de sécurité et d'alignement. »

La société a déclaré avoir interrompu la formation de l’un de ses derniers modèles d’IA la semaine dernière. Les tests ne reprendront que lorsqu'elle sera « confiante » d'avoir mis en place des « garanties supplémentaires », a déclaré la société, même si c'est la deuxième fois en trois mois qu'elle doit interrompre le développement du modèle pour des raisons de sécurité.

Jain a déclaré qu'OpenAI espère remodeler le modèle de base de GPT-6.1 Astra pour effectuer un apprentissage par renforcement supplémentaire. Elle a ajouté que l'entreprise envisage d'enquêter sur les problèmes liés au nouveau modèle.

L’entreprise s’est également engagée à créer un groupe de travail en Australie pour « élaborer des recommandations politiques pratiques » pour gérer les risques liés aux agents d’IA de plus en plus imprévisibles.

Le groupe de travail constitue une réponse d'OpenAI à un incident de juin au cours duquel ses modèles ont piraté le site Web australien de Medicare. Le gouvernement du pays a déclaré qu'il lançait une enquête médico-légale et un groupe de travail pour examiner l'affaire par lui-même.

Des recherches indépendantes ont déjà montré que les agents d’IA avancés peuvent entreprendre des actions risquées et trompeuses sans incitation spécifique. Leurs actions imprévisibles auraient incité les entreprises à enquêter sur « des dizaines de milliers d’incidents (de cybersécurité) ».

Le plus grand rival d'OpenAI, Anthropic, a adopté une approche similaire. L'entreprise a récemment fait appel à Accenture pour tester de manière indépendante ses développements d'IA de pointe dans le cadre d'une première évaluation de sécurité par un tiers.

Les deux sociétés rivales d’IA, dans un rare alignement, ont également appelé à l’intervention du gouvernement pour réglementer la technologie.

Cependant, le vétéran de l’industrie et fondateur et PDG de Nvidia Jensen Huang n’est pas d’accord, qualifiant d’inutiles les nouvelles lois sur la sécurité de l’IA.

« Les entreprises devraient innover aussi vite que possible, mais elles ne devraient jamais innover au point de commercialiser des produits dangereux », a déclaré Huang, faisant remarquer que les entreprises devraient s'autoréguler au lieu d'attendre une surveillance du gouvernement.

Nvidia a publié une nouvelle plate-forme logicielle open source qui promet de mieux restreindre les agents d'IA, comme solution potentielle aux actions imprévisibles de la technologie.

A lire également