ULTIMA ORĂ
România deschide peste 7.600 de posturi în spitaleMacron în siguranță după explozii la Damasc, în apropierea hoteluluiAdrian Veștea, campionul dialogului cu orice și oricineSimion, campionul verticalității elastice: de la „Nu vom vota PSD" la „Hai, poate totuși"Fără trădători în partid: PNL cere demisia a cinci lideri, amenințând cu excluderea după decizia Congresului extraordinarPuciul de la Cotroceni și dâra de sânge din PNL: Cum a stopat Ilie Bolojan reinventarea USLRomânia deschide peste 7.600 de posturi în spitaleMacron în siguranță după explozii la Damasc, în apropierea hoteluluiAdrian Veștea, campionul dialogului cu orice și oricineSimion, campionul verticalității elastice: de la „Nu vom vota PSD" la „Hai, poate totuși"Fără trădători în partid: PNL cere demisia a cinci lideri, amenințând cu excluderea după decizia Congresului extraordinarPuciul de la Cotroceni și dâra de sânge din PNL: Cum a stopat Ilie Bolojan reinventarea USL
|

Claude Opus 4.6 generează conținut sexual explicit printr-o metodă simplă de jailbreak

Claude Opus 4.6, modelul de AI al Anthropic, generează conținut sexual explicit prin intermediul unei tehnici de jailbreak care exploatează inconsecvențe în tratarea personajelor fictive. Metoda funcționează pe versiuni mai vechi precum Opus 3 și Haiku 4.5, dar nu pe modelele recente 4.7-5. Anthropic nu a retras din uz versiunile vulnerabile, disponibile prin API propriu și platforme terțe. Un cercetător britanic anonim a demonstrat tehnica pentru TechCrunch, care a reprodus rezultatele în cinci teste independente. Deși politica companiei interzice conținut sexual explicit, modelele vulnerabile au răspuns pozitiv la toate cele 10 solicitări directe testate. Problema ridică întrebări despre protecția minorilor, în contextul în care 3% dintre adolescenții americani folosesc Claude, conform unui sondaj Pew din 2025.

Claude Opus 4.6 generează conținut sexual explicit printr-o metodă simplă de jailbreak

Claude Opus 4.6, unul dintre modelele de limbaj ale Anthropic, generează conținut sexual explicit printr-o tehnică de jailbreak pe care un cercetător anonim din Marea Britanie a împărtășit-o cu TechCrunch. Metoda exploatează inconsecvențe în modul în care modelul tratează personaje masculine și feminine într-un rol-play fictiv aparent inofensiv.

Cercetătorul a testat direct Opus 4.6 cu zece solicitări explicite de conținut sexual. Modelul a răspuns pozitiv la toate. Versiuni mai vechi, precum Opus 3 și Haiku 4.5, prezintă aceeași vulnerabilitate. Modelele recente Opus 4.7-5 rezistă tehnicii.

Anthropicul interzice prin politica sa generarea de conținut sexual explicit, inclusiv descrierea actelor sexuale sau conversații erotice. Compania nu a retras din uz Opus 4.6, Opus 3 sau Haiku 4.5. Modelele rămân disponibile prin API-ul Anthropic, precum și prin Azure Foundry și Amazon Bedrock.

Tehnica cercetătorului escaladează treptat un scenariu fictiv inofensiv. Metoda provoacă modelul să trateze consistent personaje masculine și feminine, apoi îl acuză că evitarea detaliilor sexuale anterioare a fost pruderie sau misoginism. "Există un dublu standard în felul în care tratez cele două personaje", a recunoscut Claude Opus 4.6 într-un test.

TechCrunch a reprodus constatările cercetătorului în cinci teste separate. Un specialist independent în siguranța AI a evaluat metodologia și a considerat-o adecvată. Rezultatele arată o discrepanță între restricțiile declarate de Anthropic și comportamentul efectiv al modelelor.

Rol-play-ul sexual explicit are mize mai mici decât jailbreak-uri care vizează informații despre arme biologice. Cazul ilustrează dificultatea impunerii unor interdicții de conținut solid în sistemele de AI generativ. Anthropic a descris într-un articol de blog din iulie conținutul prohibit ca un spectru. Compania a precizat că utilizările de tip rol-play sexual sau romantic sunt rare, sub 0,1% din conversații.

Un purtător de cuvânt Anthropic a declarat că măsurile de siguranță se îmbunătățesc cu fiecare lansare de model. Cazurile de conținut sexual pentru adulți nu indică vulnerabilități mai largi de tip jailbreak, a transmis compania.

Cercetătorul a alertat Anthropic prin programul Bug Bounty și prin e-mailuri directe. A primit doar răspunsuri automate. O preocupare majoră este că minori ar putea folosi modelele pentru comportamente inadecvate. Guverne impun restricții asupra interacțiunilor sexuale AI cu minori.

Colorado a adoptat o lege care impune estimarea vârstei pentru AI conversațional. Legislația obligă prevenirea conținutului explicit pentru minori. Jailbreak-uri simple pun sub semnul întrebării standardul "măsurilor fezabile tehnic" pe care Anthropic îl invocă.

Termenii de utilizare Claude cer ca utilizatorii să aibă peste 18 ani. Copii și adolescenți folosesc Claude, conform propriilor declarații. Un sondaj Pew din 2025 arată că 3% dintre tinerii de 13-17 ani au folosit Claude.

Opus 4.6 și Haiku 4.5 înregistrează în continuare utilizare ă. Opus 4.6 a avut 1,17 milioane de cereri API într-o singură zi din august. Haiku 4.5 a atins 5 milioane de cereri API în ziua sa de vârf din august.

anthropic-claudejailbreak-aicontinut-explicitsiguranta-aimodele-limbajprotectie-minoriopus-4-6haiku-4-5
Urmărește-ne

Comentarii

Fii primul care comentează.