Récemment, OpenAI a annoncé des mesures conformes au règlement européen sur l’IA concernant la possibilité d’identifier les textes générés par une IA. Ce dispositif soulève des interrogations passionnantes sur l’avenir de la création de contenu, le respect des droits d’auteur et la transparence des systèmes d’IA. Découvrons ensemble les détails de cette initiative.
Contexte de l’initiative
Il y a quelques mois, Anthropic, une autre entreprise d’intelligence artificielle, a provoqué une polémique en annonçant que son modèle Claude introduirait un système de watermarking dans ses textes. Ce dernier consiste à modifier légèrement le choix des mots pour créer un signal identifiable. Anthropic assure que cela n’affecte ni la signification ni la qualité des textes.
Parallèlement, l’entreprise a mis au point un détecteur capable de repérer ce motif dans un texte, permettant ainsi d’identifier une création ayant pour origine Claude. Toutefois, cette technologie ne peut pas être appliquée à OpenAI ou d’autres concurrents, car le système repose sur une clé secrète propre à Anthropic.
Dans cette atmosphère de débat, OpenAI a décidé de faire connaître sa propre solution, qui emprunte certains aspects à celle d’Anthropic, mais cela reste limité. La mission est de répondre aux exigences du cadre européen sur l’utilisation des intelligences artificielles.
Le système de watermarking d’OpenAI
OpenAI a déclaré que « les clients de l’API à l’échelle mondiale pourront choisir d’activer le watermarking sur certains modèles ». Dans les semaines à venir, un watermark invisible sera ajouté aux sorties de ChatGPT et Codex au sein de l’Union Européenne. Actuellement, cette fonctionnalité sera désactivée par défaut pour l’API.
Pour l’instant, l’accès à la technologie de détection de watermarking est limité à un groupe restreint de chercheurs et d’organisations qui travaillent à son évaluation et à son amélioration. Il est crucial de noter que cette technologie présente encore des faiblesses, telles que les faux positifs et négatifs, surtout pour des textes courts, ou dans des domaines très spécifiques.
OpenAI a partagé des détails sur sa technologie : textGrain. Ce système ajoute un signal statistique invisible basant ses choix de mots, et le détecteur recherche ce signal pour identifier un passage marqué. Des mises à jour seront apportées dans les semaines à venir.
L’entreprise a également observé que le watermark pouvait être affaibli par une simple modification du texte. Par exemple, dans une évaluation des passages de 400 tokens, remplacer 10 % des mots par des synonymes a réduit l’efficacité de détection de 92 % à 66 %. Ce chiffre tombe même à 17 % lorsque 25 % des mots sont remplacés.
Étonnamment, les sorties marquées par le watermark ont reçu des scores légèrement supérieurs sur plusieurs benchmarks par rapport aux textes non marqués, malgré l’absence de différence significative dans leur performance globale.
| Benchmark | Texte non marqué (max) | Texte marqué (max) |
|---|---|---|
| Artificial Analysis Intelligence Index | 49.57 points | 49.76 points |
| AutomationBench | 34.09% | 34.86% |
| DeepSWE v1.1 | 72.80% | 71.68% |
| Terminal-Bench 4.0 | 53.90% | 56.06% |
| Terminal-Bench Science 0.1 | 56.90% | 60.00% |
| BrowseComp | 87.92% | 87.35% |
| HealthBench Professional | 64.27% | 64.60% |
| GPQA Diamond | 94.44% | 93.94% |
Enfin, il est important de garder à l’esprit que la présence d’un watermark ne garantit pas une contribution humaine et n’établit pas de propriété ou de responsabilité. L’absence de watermark ne prouve pas non plus l’authorship humain. OpenAI s’attend à réévaluer son approche à mesure que la technologie évolue et continue d’étudier la manière dont les watermarks survivent aux modifications et aux traductions.
