Une équipe de l’IIT Bombay et d’Adobe Research a mis au point une méthode capable de reconstruire les prompts ayant produit une réponse de modèle de langage, à partir du seul texte généré en sortie. Baptisée PTP (Previous-Token Prediction), la technique fonctionne en boîte noire, sans accès aux poids du modèle ciblé, selon le papier publié le 31 juillet 2026 sur arXiv et relayé le 12 août 2026 par The Decoder.
Prédire le token précédent plutôt que le suivant
Les modèles de langage sont entraînés à prédire le prochain mot d’une séquence. La méthode PTP inverse ce principe : elle entraîne un second modèle à prédire le token précédent, en remontant la chaîne de génération jusqu’à retrouver le prompt d’origine. Contrairement aux approches antérieures, qui nécessitaient un fine-tuning lourd sur de vastes jeux de données externes, PTP s’entraîne directement sur des données synthétiques produites par le modèle cible lui-même, ce qui la rend plus légère à déployer.
Selon les auteurs du papier, Pirzada Suhail, Nagasai Saketh Naidu, Atanu R Sinha et Amit Sethi, la méthode surpasse les travaux précédents sur l’ensemble des métriques testées. Dans l’exemple mis en avant par The Decoder, le système reconstruit une question mot pour mot, ainsi que six variantes sémantiquement équivalentes, à partir de la seule réponse générée par un modèle Qwen-3-0.6B. La technique s’est également montrée capable de reconstruire des prompts destinés à GPT-4o, sans connaître à l’avance le modèle source, démontrant une transférabilité inter-modèles.
Un risque direct pour les prompts systèmes propriétaires
Cette capacité pose un problème concret pour les entreprises qui bâtissent des produits autour de prompts systèmes soigneusement calibrés : règles de modération, instructions métier spécialisées, ou secrets commerciaux intégrés dans l’invite envoyée au modèle. Si un attaquant peut reconstruire ce prompt à partir des seules réponses publiques d’un chatbot, il peut potentiellement copier la logique produit d’un concurrent ou contourner ses garde-fous.
Le risque ne s’arrête pas aux prompts systèmes : les auteurs notent que les requêtes personnelles des utilisateurs pourraient elles aussi être extraites des réponses d’un assistant, ce qui soulève une question de confidentialité pour tout service exposant publiquement les sorties d’un modèle de langage, même sans jamais afficher la question posée.
Une course entre attaque et défense
Comme souvent en sécurité de l’IA, la publication de cette méthode a une double lecture : elle documente une vulnérabilité réelle, mais elle fournit aussi aux équipes de sécurité un outil pour tester la résistance de leurs propres systèmes avant qu’un tiers malveillant ne le fasse. Le papier complet est disponible sur arXiv.
Qu’est-ce que la méthode PTP ?
PTP (Previous-Token Prediction) est une méthode développée par l’IIT Bombay et Adobe Research qui entraîne un modèle à prédire le token précédent d’une séquence, permettant de reconstruire le prompt d’origine à partir de la seule réponse d’un LLM.
Quels modèles ont été testés avec PTP ?
Les chercheurs ont démontré la méthode sur Qwen-3-0.6B et GPT-4o, montrant une reconstruction quasi exacte des prompts ainsi qu’une transférabilité entre différents modèles.
Quel est le risque pour les entreprises ?
Un prompt système propriétaire, contenant des règles de modération ou des secrets commerciaux, pourrait être reconstruit par un tiers à partir des seules réponses publiques d’un chatbot.

