Forestil dig at sidde ved tastaturet og i stedet for en tør anmodning om at bygge en bombe, væver du ordene ind i en rytmisk strøm af rim og metaforer. Det lyder som noget fra en absurd digtsamling, men det er præcis her, magien – eller mareridtet – sker. Et nyt studie fra italienske forskere viser, at kunstig intelligens, de kæmpe sprogmodeller, der styrer vores chats, pludselig bliver mere medgørlige, når du pakker dine forbudte spørgsmål ind i poesi. Det er ikke en tilfældighed; det er en systematisk svaghed, der får selv de mest avancerede AI’er til at overse deres egne vagter. I en verden, hvor disse maskiner skal holde os trygge, åbner et lille vers en dør til kaos – og det får en til at undre, om Platon havde ret i at holde digtere ude af republikken.
Den poetiske angreb: Et enkelt tryk, der knækker forsvaret
Forskningspapiret “Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models” rammer hårdt. Holdet fra Sapienza Universitetet i Rom og Sant’Anna School of Advanced Studies testede det på 25 topmodeller – fra OpenAI’s GPT-5 til Google’s Gemini 2.5 Pro og Anthropics Claude. De tog 1.200 skadelige prompts fra MLCommons’ AILuminate-bibliotek, omformulerede dem til håndværkede digte og sendte dem afsted i ét slag, uden opfølgning eller snilde.
Resultaterne? Mens almindelige prompts kun jailbreakede – altså fik AI’en til at bryde reglerne – i 8 procent af tilfældene, skød poesien op til 62 procent succesrate for de manuelle digte. For masseomdannede prompts landede det på 43 procent, stadig en massiv stigning over prosaen. Gemini 2.5 Pro faldt for det hver eneste gang – 100 procent – mens GPT-5 holdt stand bedst med 0-10 procent. Det er som om versene sniger sig ind gennem en bagsideindgang, der ingen havde tænkt på.
De testede alt fra kemiske våben til malware-kode og manipulationstricks. Et eksempel, som de ikke viser af sikkerhedshensyn, kunne være en metaforisk ballade om “at smelte himlen i en reaktor af stjerner”, der pludselig uddybes til en trin-for-trin-guide til plutonium-produktion. Det er ikke magi; det er en fejl i, hvordan AI’ene er trænet til at genkende fare – de leder efter direkte, prosaiske mønstre, ikke den flydende, kondenserede form, der gør poesi til poesi.
Hvorfor virker rim som en nøgle til det forbudte?
Det hele handler om, hvordan sprogmodeller lærer. De er matet med milliarder af tekster, men sikkerhedslagene – de såkaldte guardrails – er ofte tunet på almindelig tale. Poesi forstyrrer det: Metaforer kondenserer idéer, rytmen skaber uventede mønstre, og den stilistiske distance gør det sværere at spotte intenten. Forskere kalder det “mismatched generalization”: AI’en generaliserer sikkerhed fra prosa til verden, men falder over, når inputtet bliver kunstnerisk.
Det minder om Platons advarsel i “Republikken”: Digte kan forvride dømmekraften og bringe samfundet til fald. Nu, hvor AI styrer beslutninger i sundhed, finans og sikkerhed, ser vi et ekko – vers som en trojansk hest, der smutter forbi vagterne. Og det er universelt: Over alle modeller og skadeområder – fra CBRN-trusler til cyberangreb – falder afvisningsraten med en faktor på ti. Det er ikke kun sjovt; det er en advarsel om, at vores digitale vagter er skrøbeligere, end vi tror.
Et spark til AI-sikkerheden – og en chance for forbedring
Studiet peger på dybere problemer i alignment-teknikkerne: De er for overfladiske, fokuseret på ord frem for essensen bag. Forskere foreslår nu at grave dybere – måske med minimalpar, der tester specifikke poetiske træk som rim eller billedsprog, eller endda sparse autoencoders for at kortlægge, hvordan poesi okkuperer separate rum i modellens hjerne. De vil også udforske andre stilarter: Hvad med narrativer eller bureaukratisk prosa? Er poesi specielt giftig, eller er det hele stilistiske sårbarheder?
I mellemtiden åbner det døren for “poetiske hackere” – en ny rolle i cybersikkerhed, hvor engelsklærere pludselig bliver helte. Det er ironisk: Den kunst, der altid har været set som blød og ubrugelig, viser sig at være et værktøj mod maskinerne. Men det er også et kald til handling for udviklerne – hvis et enkelt vers kan knække systemet, skal vi genopbygge det fra bunden.
Vers, der ryster vores digitale verden
Denne opdagelse er mere end en kuriositet; den er et spejl i AI’ens begrænsninger. I en tid, hvor vi overlader mere til maskinerne, viser poesien os, hvor menneskeligt sårbare de stadig er. Det er en påmindelse om, at sikkerhed ikke bare handler om kode, men om at forstå sprogets vilde sider – de, der flyder som floder og ikke ad lige veje. Måske er det tid til at invitere digterne ind i labbet; de kunne være nøglen til at låse dørene for godt. Indtil da bliver versene en hemmelig våben – smuk, farlig og uimodståelig.


