La prompt injection non ha una patch. Cos'è davvero, quali attacchi sono documentati e come limitare i danni quando usi agenti AI.
La prompt injection è il bug che non si può correggere. Se un modello legge un testo che non controlli, e quel modello può poi agire (chiamare uno strumento, mandare un messaggio, aprire una pull request, interrogare un database), chi ha scritto quel testo ha la possibilità di guidarlo. Nessuna sanificazione dell'input chiude la falla, perché la falla è il prodotto: il modello è costruito per seguire istruzioni in linguaggio naturale, e non ha modo affidabile di capire quali frasi arrivano da te e quali da una pagina web recuperata trenta secondi prima. Divento nervoso quando un cliente mi dice che il suo agente è "protetto dal system prompt". Un system prompt è una richiesta, non un confine. Quattro anni dopo che Simon Willison ha dato il nome all'attacco, nel settembre 2022, lo stato dell'arte resta la mitigazione: ridurre il raggio dell'esplosione e dare per scontato che prima o poi…