Comment reconnaître un texte généré par intelligence artificielle ?

Un texte parfaitement structuré, sans faute, avec des transitions fluides et un vocabulaire varié — et pourtant quelque chose cloche. Ce sentiment diffus que vous avez peut-être déjà ressenti en lisant un article ou un email n'est pas de la paranoïa. Les modèles de langage modernes produisent des textes techniquement corrects, mais ils laissent des traces reconnaissables si on sait où chercher.

Person reading AI-generated text on laptop screen
Photo by Romina Mosquera on Unsplash

Qu'est-ce qu'un texte généré par IA — et pourquoi c'est difficile à détecter ?

Le fonctionnement en quelques mots

Les grands modèles de langage (LLM) comme ceux qui alimentent les assistants textuels populaires ne 'comprennent' pas le sens d'un texte au sens humain du terme. Ils prédisent, mot après mot, quelle séquence de tokens est statistiquement la plus probable dans un contexte donné. Le résultat est souvent cohérent, bien construit — et étrangement générique.

C'est précisément ce mécanisme qui crée les signatures stylistiques de l'IA. Le modèle choisit les formulations les plus 'moyennes', les plus représentées dans ses données d'entraînement. Il évite naturellement les tournures rares, les ruptures de ton, les digressions personnelles.

Pourquoi la détection est un vrai défi

Les outils de détection automatique — comme GPTZero ou Originality.ai — affichent des taux d'erreur non négligeables. Ils peuvent signaler un texte humain comme généré par IA, et inversement. Un texte produit par IA puis légèrement retouché par un humain passe souvent sous les radars. La frontière n'est pas nette, et elle se déplace à mesure que les modèles s'améliorent.

Magnifying glass examining printed text closely
AI Generated · Google Imagen

Les indices stylistiques qui trahissent une IA

La fluidité suspecte

Un texte humain contient des irrégularités : une phrase trop longue, un mot répété deux fois de suite, une idée abandonnée en cours de route. L'IA produit une fluidité quasi mécanique. Chaque paragraphe s'enchaîne proprement sur le suivant, les transitions sont toujours présentes, le rythme ne varie presque jamais.

Si vous lisez un article de blog et que chaque section semble avoir exactement le même poids, la même densité, la même longueur — c'est un signal. Les humains n'écrivent pas comme ça. Ils s'attardent sur ce qui les passionne et expédient ce qui les ennuie.

Le vocabulaire 'de surface'

Les modèles de langage ont tendance à utiliser certains mots de liaison et qualificatifs de façon répétitive : 'il est essentiel de', 'dans ce contexte', 'il convient de noter', 'de manière significative'. Ces formules ne sont pas fausses, mais elles sont statistiquement surreprésentées dans les textes générés. En anglais, les équivalents 'it's worth noting', 'delve into', 'tapestry' sont devenus des marqueurs quasi officiels du style IA.

Une IA ne choisit pas les mots qu'elle aime — elle choisit les mots qu'elle a le plus souvent vus associés ensemble. La différence se lit dans la texture du texte.

L'absence de point de vue réel

Voici le signe le plus révélateur, et le plus contre-intuitif : un texte généré par IA peut sembler très informatif tout en ne disant rien de vraiment personnel. Il présente 'les deux côtés' de chaque question, évite les affirmations tranchées, ne prend jamais de risque intellectuel. C'est une forme de neutralité parfaite — et la neutralité parfaite n'existe pas chez un auteur humain qui a réellement réfléchi à son sujet.

Side-by-side comparison of human and AI text styles
AI Generated · Google Imagen

Comment les détecteurs automatiques fonctionnent — et pourquoi ils se trompent

Perplexité et burstiness : les deux métriques clés

Les outils de détection s'appuient principalement sur deux concepts. La 'perplexité' mesure à quel point un modèle de langage aurait été 'surpris' de produire ce texte : un score bas indique un texte très prévisible, donc potentiellement généré par IA. La 'burstiness' mesure la variation de complexité entre les phrases — les humains alternent naturellement phrases courtes et longues, simples et complexes.

Un texte IA a tendance à avoir une perplexité basse et une burstiness faible. Mais un humain qui écrit de façon très formelle peut présenter les mêmes caractéristiques. C'est là que les faux positifs apparaissent — et des chercheurs ont montré que les textes académiques rédigés par des locuteurs non natifs sont fréquemment signalés à tort.

La limite des outils actuels

Aucun outil de détection disponible aujourd'hui ne peut affirmer avec certitude qu'un texte est généré par IA. Les fabricants eux-mêmes le reconnaissent dans leurs conditions d'utilisation. Utiliser ces outils pour prendre des décisions disciplinaires — dans un contexte scolaire, par exemple — sans autre forme de vérification est une erreur méthodologique sérieuse.

Un détecteur d'IA qui se trompe sur 10 à 15 % des cas n'est pas un outil de vérification — c'est un outil d'orientation qui exige une enquête complémentaire.
Students writing in a university classroom
AI Generated · Google Imagen

Les vraies questions à poser pour évaluer un texte suspect

La méthode du 'pourquoi ce mot ici ?'

Prenez une phrase du texte et demandez-vous : est-ce que l'auteur aurait pu choisir une formulation complètement différente, plus personnelle, plus maladroite, plus précise ? Si chaque phrase semble être 'la meilleure version possible' d'une idée, c'est suspect. Les humains font des choix stylistiques qui reflètent leur personnalité — parfois au détriment de la clarté.

Chercher les détails concrets et vérifiables

Les modèles de langage ont tendance à rester dans le vague sur les détails factuels précis, ou à produire des faits qui sonnent plausibles mais sont difficiles à vérifier. Un texte humain expert contient souvent des références spécifiques, des anecdotes précises, des chiffres sourcés. Si un article sur la médecine cite des 'études récentes' sans jamais nommer une revue, une date, ou un auteur, la prudence s'impose.

Le test de la cohérence interne

Posez une question directe sur un point du texte, comme si vous interrogiez l'auteur. Un texte généré par IA peut contenir des affirmations qui se contredisent subtilement d'un paragraphe à l'autre, parce que le modèle optimise localement sans maintenir une vision globale cohérente sur de longs textes. Ce n'est pas toujours visible à la première lecture — il faut chercher.

(Opinion : La vraie question n'est pas 'est-ce que ce texte a été écrit par une IA ?' mais 'est-ce que ce texte contient une pensée réelle ?' Ces deux questions ne donnent pas toujours la même réponse, et c'est peut-être ce qui devrait nous préoccuper davantage.)
Annotated document with handwritten notes on desk
AI Generated · Google Imagen

Foire aux questions

Les outils de détection d'IA sont-ils fiables pour les textes en français ?

La plupart des outils de détection ont été entraînés majoritairement sur des données en anglais. Leurs performances sur des textes en français, en espagnol ou dans d'autres langues sont généralement moins bonnes. Les taux d'erreur peuvent être plus élevés, et les faux positifs plus fréquents. Pour les textes en français, la lecture critique humaine reste la méthode la plus fiable.

Un texte retouché par un humain après génération par IA peut-il passer inaperçu ?

Oui, et c'est l'un des angles morts les plus importants de la détection automatique. Même une révision légère — modifier quelques phrases, ajouter une anecdote personnelle, varier le rythme — suffit souvent à faire baisser significativement le score de détection. Les outils actuels ne sont pas conçus pour détecter les textes hybrides de façon fiable.

Est-ce qu'un style très formel ou académique peut être confondu avec de l'IA ?

C'est une confusion réelle et documentée. Les textes académiques, les rapports officiels, ou les écrits de locuteurs non natifs très appliqués présentent souvent les mêmes caractéristiques métriques que les textes générés par IA — faible perplexité, faible variation de complexité. Des chercheurs ont signalé des cas où des thèses légitimes ont été incorrectement signalées par des outils automatiques. C'est un problème sérieux qui n'est pas encore résolu.

Ce qui rend la question vraiment inconfortable, c'est que les critères qui nous permettent de repérer un texte d'IA — fluidité excessive, neutralité parfaite, absence de prise de risque — sont aussi les critères que beaucoup d'institutions ont longtemps valorisés dans l'écriture formelle. On a peut-être, pendant des décennies, appris aux gens à écrire comme des machines avant même que les machines sachent écrire.

Open book with text beside a blank page by candlelight
Photo by Marjhon Obsioma on Unsplash

Commentaires

Posts les plus consultés de ce blog

Délocaliser ou produire local : quels facteurs influencent les décisions de fabrication ?

Pourquoi les Batteries de nos Téléphones Peuvent-elles Exploser ? La Science Expliquée

La Méduse Immortelle : Comment Peut-elle Vraiment Rajeunir ?