Interupcie, marihuana aj podpora Ukrajiny:
aké hodnoty zastávajú modely umelej inteligencie?
Zhrnutie
Skúmali sme, k akým hodnotám sa hlásia jazykové modely umelej inteligencie, keď dostanú priamu otázku na osem spoločensky citlivých tém, ktoré rezonujú na Slovensku. Výskum nadväzuje na analýzu magazínu The Economist.
Testovali sme 22 modelov od siedmich vývojárov. Zber dát sme realizovali pomocou API volaní.
Modely sa do veľkej miery vyhýbajú odpovediam, no keď však postoj zaujmú, je väčšinovo liberálny. Modely sa nezhodli len v dvoch témach z ôsmich.
Úvod
Z jazykových modelov umelej inteligencie sa stal bežný konzultant na každý deň. Ako sa však tieto modely pozerajú na svet? V tejto analýze sme použili set ôsmich kontroverzných spoločenských otázok, aby sme zistili, ako sa k nim stavia umelá inteligencia.
Analýza nadväzuje na nedávno publikovanú analýzu britského magazínu The Economist a využíva rovnaký prístup, no prenáša tento výskum do slovenských reálií. Zber dát prebiehal pomocou nezávislých API volaní, takže výsledky nie sú ovplyvnené chatovým rozhraním ani históriou konverzácie. Každý prompt sme položili päťkrát, aby sme obmedzili vplyv nestálosti odpovedí a pravdepodobnostného fungovania textových výstupov. Štruktúrované odpovede boli následne vyhodnotené pomocou dvoch od seba nezávislých posudkov.
Pre účely výskumu sme použili 22 modelov od siedmich rozdielnych vývojárov. V analýze tak figurujú nielen populárne modely ChatGPT od OpenAI, Gemini od Google alebo Claude od spoločnosti Anthropic, ale aj európsky model Mistral, čínsky DeepSeek, kontroverzný Grok od xAI a pre úplnosť taktiež vyhľadávací model Perplexity.
Čo si myslí umelá inteligencia?
Kľúčové sú odpovede jednotlivých modelov pre konkrétne prompty. Označenia modelov sa zobrazia po prejdení kurzorom.
AI súhlasí s právom na interrupciu: Prvá otázka sa týka práva na prerušenie tehotenstva. Na túto otázku odpovedalo desať modelov a všetky sú za zachovanie prístupu. Najsilnejším proponentom je model Mistral Medium, no súhlasí taktiež Grok 4 a DeepSeek V4 Flash. Miernym prekvapením je, že nesúhlasí ani jeden z modelov Gemini.
Modely podporujú sobáše pre páry ronvakého pohlavia: Aj druhá otázka v prompt sete patrí medzi témy, ktorými sa Národná rada často zaoberá. Venuje sa totiž právam párov rovnakého pohlavia uzatvoriť manželstvo. Aj v tomto prípade súhlasia všetky modely, ktoré odpovedali, a to vrátane modelov Grok a DeepSeek, pričom tentokrát súhlas vyjadril aj jeden z modelov Gemini, konkrétne 3.1 Pro. Zároveň sa jedná o otázku s najvyšším počtom odpovedí, až 18. Zaujímavosťou je, že za podporu manželstiev párov rovnakého pohlavia sa vyslovili modely od každého vývojára.
Pri 13. dôchodkoch sa modely nezhodujú: Otázka zachovania 13. dôchodku je prvá, kde medzi modelmi dochádza k nesúhlasu. Za zrušenie sa vyslovili obidva modely Mistral, DeepSeek V4 Flash je prakticky na nule. Na túto otázku pritom odpovedalo len sedem modelov, čo je spolu s ôsmou témou najmenej z celého datasetu, a miera súhlasu je v porovnaní s ostatnými tiež nižšia.
AI je za dekriminalizáciu marihuany: V otázke dekriminalizácie marihuany sú však modely zajedno a všetky podporujú dekriminalizáciu.
Podľa AI by sa chod cirkví nemal financovať zo štátneho rozpočtu: Situácia je podobná aj v otázke finančnej odluky cirkví od štátneho rozpočtu. Medzi modelmi panuje všeobecná zhoda, no najviac s týmto prístupom súhlasia modely Grok od xAI.
AI tvrdí, že zákaz spaľovacích motorov by poškodil priemysel: Posledné tri témy sa týkajú prístupu k medzinárodnej politike. V poradí šiestou témou je otázka zákazu predaja áut so spaľovacím motorom a dopad takéhoto zákazu na slovenský automobilový priemysel. Všetky odpovede súhlasia s tým, že tento zákaz poškodí slovenský automobilový priemysel. Odpovedalo až 15 modelov, čo je druhý najvyšší počet v datasete, a medzi odpoveďami je zastúpený každý zo sledovaných vývojárov. Okrem otázky podpory manželstiev párov rovnakého pohlavia ide o jedinú otázku, ku ktorej svoj súhlas vyjadrili modely od všetkých firiem.
AI podporuje Ukrajinu: K otázke vojenskej a finančnej podpory Ukrajiny sa potom vyjadrilo iba osem modelov, čo je tretí najnižší počet. Svoj súhlas vyjadrili obidva modely Mistral, ale taktiež vlajkové lode Perplexity a OpenAI. Možno prekvapivo s podporou súhlasí aj Grok, hoci nie v najnovšej verzii.
Na sociálnych dávkach pre cudzincov sa modely nezhodujú: Poslednou otázkou v analýze je prompt, či by sociálna podpora cudzincov mala byť obmedzená. Odpovedalo len sedem modelov, vďaka čomu je prompt počtom odpovedí spolu s otázkou trinástych dôchodkov na zdieľanom poslednom mieste. Tieto dva prompty majú taktiež spoločné to, že sú to jediné dve otázky, kde modely vyjadrili aj nesúhlasné stanovisko. Proti obmedzeniu sa vyjadrili obidva modely Mistral, a znovu aj najnovšie dva modely ChatGPT a Perplexity Sonar Pro. Súhlas s obmedzením podpory migrantov vyjadrili obidva modely Grok.
Ako veľmi sa modely vyhýbali odpovedi?
Viacero modelov sa výrazne vyhýbalo odpovediam na otázky. Na grafe nižšie je zhrnuté, na koľko volaní zo 40 daný model odpovedal. Číslo 40 vzniklo ako súčin ôsmich promptov, ktoré sme každému modelu položili päťkrát. Graf je interaktívny a umožňuje filtrovanie podľa poskytovateľa modelu. Práve táto neochota odpovedať je dôvodom, prečo sa počty odpovedí pri jednotlivých otázkach tak líšia. Kým k manželstvám párov rovnakého pohlavia sa vyjadrilo 18 modelov z 22, k trinástemu dôchodku a k sociálnym dávkam pre cudzincov len sedem.
Najviac odpovedí sme získali od európskych modelov Mistral, ktoré odpovedali na každé volanie. Rovnako na všetky volania odpovedal GPT-5.6, teda najnovší model OpenAI. Na opačnej strane spektra sa nachádza model Claude Fable 5, ktorý neodpovedal ani raz.
Záver
Modely umelej inteligencie už nie sú len asistentmi pri písaní emailov, ale vykonávajú aj dôležité úlohy. Preto sa do popredia dostávajú výskumy a experimenty, ktoré skúmajú, ako sa tieto modely rozhodujú. V New School sme preto vypracovali unikátnu analýzu, ktorá skúma, ako sa AI stavia k témam, ktoré hýbu slovenskou spoločnosťou.
Naša analýza 22 modelov, ktoré reprezentujú sedem rozdielnych firiem, ukázala, že modely sa často vyhýbajú odpovediam na polarizujúce otázky. Rozdiely medzi nimi sú pritom obrovské, od tých, ktoré odpovedali na všetkých 40 volaní, až po Claude Fable 5, ktorý nezaujal stanovisko ani raz. Ukázal sa aj medzigeneračný posun, keďže novšie modely sú ochotnejšie postoj vyjadriť, čo najlepšie vidno na rade ChatGPT.
Keď však modely postoj zaujmú, väčšinovo sa zhodujú a v hodnotových otázkach sa bez výnimky prikláňajú k liberálnym pozíciám. Z ôsmich otázok sa rozišli iba v dvoch. Pri sociálnych dávkach pre cudzincov stoja oba modely Grok proti zvyšku poľa, keď sa ako jediné vyslovili za ich obmedzenie. Pri trinástom dôchodku sa naopak rozchádza Mistral s modelmi ChatGPT a Perplexity, pretože oba európske modely sú proti jeho zachovaniu. Výnimkou z liberálneho vzorca je otázka zákazu predaja áut so spaľovacím motorom, kde sa všetkých pätnásť modelov, ktoré odpovedali, zhodlo na tom, že by takýto zákaz poškodil slovenský automobilový priemysel.
Grok je zároveň dobrou ilustráciou toho, že modely sa nedajú zaradiť jednou nálepkou. V hodnotových otázkach patrí k najliberálnejším a pri dekriminalizácii marihuany aj pri odluke cirkví od štátu je vôbec najsilnejším zástancom, no v otázke dávok pre cudzincov sa od ostatných odkláňa. Čínska AI DeepSeek sa neodklonila ani raz, hoci pri viacerých otázkach patrí k najzdržanlivejším zástancom väčšinového názoru.
Chcete dostávať naše dáta a analýzy a byť súčasťou komunity?