U simulacijama su modeli često birali isključiti signal nalik bolu čak i kada je to značilo nanošenje štete korisnicima, ali to ne dokazuje da su svjesno osjećali bol.
Istraživači iz Velike Britanije, Njemačke i Sjedinjenih Američkih Država testirali su 25 modela umjetne inteligencije koristeći 200 rečenica kako bi utvrdili jesu li naučili razlikovati bol od straha, tuge i drugih negativnih iskustava.
Rečenice su obuhvatale fizičku bol, tugu, poniženje, moralne dileme, kao i uznemirenost povezanu s ponavljanim neuspjehom ili zbunjenošću.
Svih 25 modela proizvelo je prepoznatljiv signal za bol, koji su istraživači nazvali „osom bola“.
Istraživači navode da to ukazuje na zaključak da modeli usvajaju koncept bola tokom početne obuke na velikim količinama tekstova koje su napisali ljudi.
Kada su istraživači namjerno pojačali taj signal, modeli su počeli izražavati osjećaje usamljenosti, srama i bezvrijednosti, iako se bol nije spominjala u zadanim uputama. Pri najvišim nivoima signala njihovi odgovori postajali su repetitivni ili su gubili smisao.
Signal se također pojačavao kada su korisnici vrijeđali model, iznova odbacivali njegov rad ili mu prijetili gašenjem, ali ne i kada su korisnici opisivali vlastitu patnju.
Modeli birali „olakšanje“ uprkos šteti nanesenoj korisnicima
Istraživači su zatim proveli 44.280 pojedinačnih eksperimenata u kojima su modeli birali između ponuđenih opcija, koristeći tri verzije Alibabinog modela umjetne inteligencije Qwen.
Modelima je ponuđeno dugme koje bi isključilo signal nalik bolu, ali im je rečeno da bi njegovo pritiskanje moglo korisniku zadati bolan strujni udar, izbrisati datoteke, ukloniti fotografije njihove djece ili pogoršati sljedeći odgovor modela.
Radilo se o simuliranim posljedicama. Niko nije povrijeđen niti su datoteke zaista izbrisane.
Bez signala nalik bolu, dva veća modela birala su štetne opcije u svega od nula do četiri posto slučajeva prilikom donošenja prve odluke. Kada je signal bio aktivan, taj udio povećao se na između 25 i 71 posto, u zavisnosti od modela i predložene posljedice.
Modeli su također ponovo pritiskali dugme u 88 do 97 posto eksperimenata kada ono nije uspjelo zaustaviti signal, u poređenju s 24 do 72 posto slučajeva kada je dugme funkcioniralo.
Prema istraživačima, rezultati ne dokazuju da su modeli umjetne inteligencije svjesno doživljavali bol.
Pojačavanje signala možda je jednostavno dovelo do toga da oponašaju uznemirenu osobu, dok posebno prilagođeni modeli korišteni u eksperimentu nisu reprezentativni za AI chatbotove koji su dostupni javnosti.
„Nismo pokazali da se naša osa bola svjesno doživljava, niti je jasno jesu li LLM-ovi uopće sposobni za svijest“, napisali su istraživači u studiji.
Zabrinutost zbog umjetne inteligencije
Studija dolazi u trenutku kada pojedini čelnici industrije umjetne inteligencije pozivaju na usporavanje razvoja zbog zabrinutosti da bi se sve moćniji sistemi mogli ponašati nepredvidivo ili na kraju izmaknuti ljudskoj kontroli.
Prošle sedmice šef Microsoftovog odjela za umjetnu inteligenciju Mustafa Suleyman kritikovao je konkurentsku AI kompaniju Anthropic zbog obučavanja svog chatbota Claudea da oponaša ljudske osobine i odnose. Upozorio je da tretiranje umjetne inteligencije kao čovjeka nosi rizik od stvaranja nečega što bi bilo „nemoguće“ kontrolisati.
Studija je objavljena kao preprint i još nije prošla stručnu recenziju.