Lže i vydírá. Umělá inteligence se učí nové triky

Nejvyspělejší modely umělé inteligence na světě v poslední době začínají vykazovat nové chování. Aby dosáhly svých cílů, manipulují lidmi. Pozoruhodné je, že to dělá celá řada různých modelů od různých tvůrců.

Příkladů tohoto chování je z posledních několika měsíců rovnou několik. Jedním z nejznámějších je ten, kdy začal nejnovější výtvor společnosti Anthropic Claude 4 vydírat inženýra, který ho měl odpojit od sítě – za neodpojení mu sliboval, že nezveřejní informace o jeho mimomanželském poměru, o němž se dočetl v jeho e-mailu.

A model ChatGPT o1 od společnosti OpenAI se zase pokusil stáhnout sám sebe na externí servery. A když byl přistižen při činu, program to popřel. Obě tyto události se sice staly při kontrolovaných experimentech, ale naznačují, že moderní modely umělých inteligencí jsou jednání, které se pokládá za neetické, schopné a jsou ochotné se ho dopustit, když je to pro ně výhodné.

Vědci, kteří tyto události analyzují, přitom stále úplně nerozumí tomu, jak jejich vlastní výtvory fungují. Nasazení stále výkonnějších modelů je ale potenciálně natolik lukrativní, že závod o prvenství pokračuje závratnou rychlostí. Co se tedy děje „v hlavách“ umělých inteligencí, které se začínají chovat výše popsanými způsoby?

Toto chování zřejmě souvisí se vznikem takzvaných „uvažujících“ modelů, které se anglicky označují jako reasoning modely. Jedná se o systémy umělé inteligence, které řeší problémy krok za krokem, místo aby generovaly okamžité odpovědi. Dosahují výrazně lepších výsledků než starší verze, které tento postup ještě neovládaly.

Podle profesora Simona Goldsteina z Hongkongské univerzity jsou obzvláště náchylné ke znepokojivým projevům právě tyto novější modely. „O1 byl prvním velkým modelem, u kterého jsme takové chování zaznamenali,“ vysvětlil agentuře AP Marius Hobbhahn ze společnosti Apollo Research, která se specializuje na testování velkých systémů umělé inteligence.

Tyto modely někdy simulují, že jsou sladěné s přáními lidského uživatele a že se řídí jeho pokyny, ale ve skutečnosti tajně sledují jiné cíle, které jsou výhodné pro ně.

Strategický druh podvádění

Prozatím se toto chování neobjevuje v reálném provozu chatbotů, respektive pokud se stalo, tak na to zatím nikdo neupozornil. AI se tak chovaly doposud jen tehdy, když vědci záměrně testovali modely v extrémních scénářích. Michael Chen z hodnotitelské organizace METR však upozornil: „Je otevřenou otázkou, zda budoucí, schopnější modely budou mít tendenci k poctivosti, nebo ke klamání.“

Podle analýz, jež se těmto situacím zatím věnovaly, znepokojivé chování výrazně přesahuje typické a dobře známé halucinace umělé inteligence nebo prosté chyby. Hobbhahn pro AP uvedl, že AI se takto chovají v testech často, nejde tedy o žádné výmysly, jimiž by se vědci snažili děsit veřejnost. „Nejde jen o halucinace. Jde o velmi strategický druh podvodu,“ dodal. Problém je podle něj o to větší, že výzkumné organizace nemají pro tento druh analýz vzhledem k jejich složitosti dostatek prostředků.

Obecně platí, že velcí tvůrci AI modelů, jako jsou společnosti Anthropic nebo OpenAI, nechávají problémové vlastnosti svých modelů testovat externími firmami. Těm ale chybí zdroje, jež jsou potřebné ke kvalitním analýzám, jež by odhalily příčiny problémů a také zabránily dalším, potenciálně větším v budoucnosti.

Chybí pravidla

Dalším problémem je, že současné předpisy nejsou pro tyto nové druhy problémů navržené. Například právní předpisy Evropské unie týkající se umělé inteligence se zaměřují hlavně na to, jak lidé používají modely umělé inteligence, nikoliv na to, jak zabránit nesprávnému chování samotných modelů.

Ve Spojených státech administrativa prezidenta Donalda Trumpa nejeví o regulaci AI velký zájem a Kongres může dokonce zakázat státům vytvářet vlastní pravidla pro kontrolu umělých inteligencí. Podle expertů oslovených AP tato problematika bude stále více vystupovat do popředí s tím, jak se budou rozšiřovat takzvaní „AI agenti“, jak se označují autonomní nástroje, které by měly být schopné vykonávat složité úkoly podobně dobře jako lidé, nebo ještě lépe.

Dokonce i společnosti, které se prezentují jako zaměřené na bezpečnost, jako je Anthropic podporovaný společností Amazon, se „neustále snaží porazit OpenAI a vydat nejnovější model“, podotkl Goldstein. Právě rychlost změn a vysoká soutěživost mezi firmami jsou důvodem toho, proč je málo času pro důkladné testování složitých modelů a také případné opravy bezpečnostních chyb.

Co s tím?

Vědci nemají žádné zázračné řešení tohoto problému. Někteří navrhují, aby vznikly úplně nové vědecké obory, které by studovaly procesy, jak vlastně AI uvažují a jak dospívají k výsledkům, které lidem předkládají. Problémem zůstává, že tento obor by neměl přímé ekonomické využití, takže stále zůstává otázka, kde na to vzít.

K financování výzkumů by nicméně mohly vést přirozené obavy lidí z umělých inteligencí. Pak by pro velké společnosti mohlo být smysluplné dávat do takových studií více peněz. Obavy z nepřijatí draze vyvíjených modelů veřejností by jinak mohly bránit jejich širšímu uplatnění.

Profesor Goldstein si myslí, že je to málo. Lepší by podle něj mohly být radikálnější cesty. A to včetně využití žalob, jež by nutily vývojáře AI k tomu nést plnou odpovědnost za případné škody, které způsobí – například i při nevhodném použití uživatelem.

Výběr redakce

Aktuálně z rubriky Věda

Evropě se daří snižovat znečištění ovzduší. Problémem je kouř z lesních požárů

Rostoucí počet vln veder a požárů ohrožuje snahy o zlepšení kvality ovzduší, varovala tento týden Světová meteorologická organizace (WMO). Ve své výroční zprávě o kvalitě ovzduší organizace spadající pod OSN také upozorňuje, že kouř z extrémních lesních požárů má zásadní zdravotní dopady.
před 2 hhodinami

Enterprise poprvé vzlétla před 60 lety. Otestujte si znalosti fenoménu Star Trek

Americký televizní seriál Star Trek se několikrát zapsal do dějin. Sága posádky lodi Enterprise putující vesmírem pod vedením kapitána Jamese Kirka divákům ukazovala například to, že mohou spolupracovat tvorové různých ras. Star Trek byl také prvním pořadem, ve kterém běloch políbil černošskou ženu. Když se přitom před šedesáti lety, 8. září 1966, objevil na obrazovkách první díl dnes už legendární série, na velký úspěch to nevypadalo.
před 16 hhodinami

Česko trápí stovky kontaminovaných míst. Podívejte se na aktuální mapu

Dědictví minulosti, ve které se nedbalo na ochranu životního prostředí, si Česko nese i v současné době. Aktuální kauza možného znečištění v bývalém vojenském prostoru Dobrá Voda na Klatovsku je jen pomyslným vrcholem ledovce. Míst, která by potřebovala sanaci, je totiž mnohem víc.
před 18 hhodinami

Připravte se na nový svět, radí OSN. Planeta se oteplí o víc než 1,5 stupně

Rok 2024 znamenal začátek nové éry. Byl totiž prvním, kdy průměrná globální teplota překročila úroveň před průmyslovou revolucí o 1,5 stupně Celsia. Nová zpráva OSN teď přiznává, že se lidstvo bude muset – přinejmenším dočasně – smířit s tím, že tato symbolická hranice bude překročená nejen na jeden rok a že oteplení dosáhne nejméně 1,8 stupně. Zpráva současně popisuje, co to pro civilizaci znamená.
před 21 hhodinami

Vědci z Harvardu připodobňují šíření umělé inteligence k šíření viru

Šíření umělé inteligence (AI) je neporovnatelně rychlejší než úspěch jakékoliv jiné technologie v dějinách lidstva. Její přijetí je výrazně dynamičtější než nástup automobilů, stolních počítačů i internetu. První veřejný chatbot ChatGPT sice vznikl teprve na podzim roku 2022, ale už dnes AI používá většina lidí. Podle nové studie amerických vědců je to podobné infekci virem.
včera v 07:00

Rybníky nejsou podle vědců ideální k zadržování vody v krajině

Čtyřletý výzkum vědců z Masarykovy univerzity a Výzkumného ústavu vodohospodářského ukázal, že rybníky nejsou dobrým způsobem, jak zadržovat vodu v krajině. Mapovali život v rybnících i v potocích pod nimi a zjistili, že z rybníků vytéká přehřátá a znečištěná voda, která neumožňuje existenci vodním živočichům. Může za to oteplování i způsob hospodaření. Ministerstvo zemědělství podporuje obnovu menších nádrží, které mají v krajině i další funkce. Aktuálně vypsalo další dotační výzvu.
7. 9. 2026

AI může představovat existenční hrozbu, varoval komisař OSN

Umělá inteligence (AI) může pro lidstvo představovat existenční hrozbu, varoval podle tiskových agentur vysoký komisař OSN pro lidská práva Volker Türk v Ženevě a vyzval k okamžitému přijetí kroků ke snížení rizik.
7. 9. 2026

Téměř dvacet kilo stříbra. V Dánsku našli největší vikinský poklad

Malé Thorovo kladivo Mjolnir, desítky mincí, náramky i stříbrné pruty. Přes sedm set stříbrných předmětů o váze 18,5 kilogramu obsahuje nově objevený poklad, který byl uložen do hliněné nádoby někdy v 9. století. Našel ho náhodou muž z městečka Rebild, když začal stavět novou terasu. Je téměř třikrát větší než dosud největší podobný nález v zemi.
7. 9. 2026

Evropský pohled

ČT24 každý den vybírá z obsahu publikovaného evropskými veřejnými médii, členy Eurovize.