Sztuczna inteligencja zawęża zakres przekazywanych informacji

Chatboty oparte na sztucznej inteligencji coraz częściej zastępują tradycyjne wyszukiwarki jako pierwsze miejsce, do którego zwracamy się po informacje. Badanie naukowców związanych m.in. z Uniwersytetem Kopenhaskim pokazuje jednak, że odpowiedzi dużych modeli językowych zawierają znacznie mniej zróżnicowaną wiedzę niż wyniki klasycznego wyszukiwania internetowego. Autorzy wskazują na ryzyko „knowledge collapse” – stopniowego zawężania zakresu informacji, z którymi mają kontakt użytkownicy.
Jeszcze niedawno odpowiedzi na trudniejsze pytania szukaliśmy przede wszystkim za pomocą wyszukiwarki internetowej. Trzeba było przejrzeć kilka lub kilkanaście wyników, wejść na różne strony, porównać źródła, a często także zmierzyć się z informacjami, które sobie przeczyły. Rozwój chatbotów opartych na sztucznej inteligencji zasadniczo zmienia ten model. Coraz częściej użytkownik zadaje jedno pytanie i otrzymuje jedną, uporządkowaną odpowiedź. Jest to wygodniejsze i szybsze. Jednocześnie może jednak oznaczać, że dociera do niego znacznie węższy fragment dostępnej wiedzy.
Na takie zjawisko wskazują autorzy badania prowadzonego przez naukowców związanych z Uniwersytetem Kopenhaskim, Uniwersytetem w Aalborgu oraz amerykańskimi ośrodkami badawczymi. Analizowali oni różnorodność wiedzy przekazywanej przez duże modele językowe i porównali ją z informacjami, do których prowadzi tradycyjne wyszukiwanie internetowe. Praca została udostępniona jako preprint i przyjęta na konferencję EMNLP 2026.
AI odpowiada podobnie, nawet kiedy pytamy inaczej
.Badacze sprawdzili 27 dużych modeli językowych na 155 tematach odnoszących się do 12 państw. Każdy temat przedstawiali modelom na 200 różnych sposobów, wykorzystując warianty pytań oparte na rzeczywistych zapytaniach użytkowników. Łącznie przeanalizowali około 1,7 mln odpowiedzi zawierających około 70 mln pojedynczych stwierdzeń. Dzięki temu mogli sprawdzić nie tylko, czy modele udzielają poprawnych odpowiedzi, lecz przede wszystkim, jak szeroki zakres faktów i perspektyw pojawia się przy wielokrotnym zadawaniu podobnych pytań.
Wniosek okazał się wyraźny: wszystkie badane modele dostarczały użytkownikom bardziej jednorodnego zestawu informacji niż zwykłe wyszukiwanie internetowe. – Każdy testowany przez nas model językowy dostarcza użytkownikom bardziej ujednoliconych informacji niż proste wyszukiwanie w Google we wszystkich analizowanych przez nas tematach – wyjaśnia Dustin Wright, główny autor badania, wcześniej związany z Department of Computer Science Uniwersytetu Kopenhaskiego, a obecnie pracujący na Uniwersytecie w Aalborgu. Oznacza to, że chatbot nie tylko zmienia sposób poszukiwania odpowiedzi. Może również zmieniać sam zestaw informacji, z którym użytkownik ma szansę się zetknąć.
Nawet GPT-5 mniej różnorodny niż wyszukiwarka
.Badacze analizowali tematy bardzo różnego rodzaju. Były wśród nich zagadnienia dotyczące broni jądrowej, małżeństwa, pornografii, rasizmu i ludobójstwa, ale także pytania silnie związane z kontekstem konkretnych państw – dotyczące m.in. Marine Le Pen, wojny o Falklandy czy K-popu. Według wyników badania nawet model generujący najbardziej zróżnicowany zestaw informacji – GPT-5 firmy OpenAI – dostarczał co najmniej 18,7 proc. mniej zróżnicowanych informacji niż Google. Autorzy zauważyli również, że nowsze modele wypadają pod tym względem lepiej od starszych, a mniejsze modele potrafią w niektórych przypadkach generować bardziej zróżnicowane treści niż większe.
Nie oznacza to więc, że rozwój modeli językowych nie przynosi poprawy. Przeciwnie – autorzy badania podkreślają, że najbardziej współczesne systemy są pod względem różnorodności wiedzy lepsze od poprzedników. Problem pozostaje jednak widoczny w porównaniu z tradycyjnym modelem korzystania z internetu. W wyszukiwarce użytkownik otrzymuje dostęp do wielu źródeł, zbudowanych przez różnych autorów, instytucje i społeczności. Odpowiedź chatbota jest natomiast wynikiem syntezy wykonywanej wewnątrz jednego systemu. Nawet gdy jest długa i wielowątkowa, może opierać się na stosunkowo powtarzalnym zbiorze twierdzeń.
Dlaczego modele językowe ujednolicają wiedzę?
.Zdaniem autorów badania częściowe wyjaśnienie tkwi w samej konstrukcji modeli językowych. Modele uczą się na bardzo dużych zbiorach tekstów, próbując rozpoznawać występujące w nich prawidłowości. W procesie treningu szczególnie dobrze utrwalają więc wzorce, które pojawiają się często. Informacje rzadsze, nietypowe albo znajdujące się na obrzeżach dominującego sposobu opowiadania o danym zagadnieniu mogą być reprezentowane słabiej.
W pewnym sensie model dokonuje ogromnej kompresji dostępnej wiedzy. A kompresja z natury rzeczy oznacza wybór tego, co najbardziej charakterystyczne i powtarzalne, oraz ograniczenie znaczenia elementów występujących rzadziej. Prof. Isabelle Augenstein z Uniwersytetu Kopenhaskiego porównuje ten proces do globalizacji. Współczesny człowiek może znaleźć te same produkty i te same sieci kawiarni niemal wszędzie na świecie. Jest to wygodne i daje liczne korzyści, ale zarazem prowadzi do zmniejszenia różnorodności. Podobny mechanizm może występować w przypadku informacji dostarczanych przez AI.
Najpopularniejsza wiedza może stawać się jeszcze popularniejsza
.Konsekwencje tego zjawiska mogą wykraczać poza pojedynczą odpowiedź chatbota. Jeżeli miliony użytkowników będą korzystały z modeli językowych jako podstawowego sposobu zdobywania informacji, coraz częściej będą otrzymywać podobny zestaw faktów, argumentów i perspektyw. – Ryzykujemy eksponowanie ludzi na mniejszą liczbę perspektyw i węższy zakres wiedzy – ostrzega Isabelle Augenstein.
Może wówczas powstać mechanizm wzmacniający treści już dominujące. To, co pojawia się najczęściej w zbiorach treningowych, jest chętniej odtwarzane przez modele; treści najczęściej odtwarzane przez modele stają się z kolei bardziej widoczne dla ludzi. Jednocześnie informacje niszowe, lokalne albo reprezentujące mniej rozpowszechnione punkty widzenia mogą stopniowo tracić znaczenie. Nie chodzi przy tym koniecznie o świadome eliminowanie określonych informacji. Mechanizm może wynikać po prostu ze statystycznego charakteru działania systemu.
„Knowledge collapse”. Co jeśli AI zacznie uczyć się przede wszystkim od AI?
.Badacze zwracają uwagę na jeszcze jeden problem. Wraz ze wzrostem popularności sztucznej inteligencji coraz większa część tekstów publikowanych w internecie będzie powstawała przy pomocy modeli językowych. Tymczasem internet pozostaje jednym z podstawowych źródeł danych wykorzystywanych do trenowania kolejnych generacji modeli. Może więc powstać pętla: sztuczna inteligencja generuje teksty, teksty te trafiają do internetu, a następnie kolejne modele uczą się na materiałach, które wcześniej zostały wygenerowane przez inne systemy.
Jeżeli informacje wytwarzane przez AI są już mniej różnorodne niż pierwotne teksty tworzone przez ludzi, powtarzanie takiego procesu mogłoby prowadzić do coraz większego zawężania rozkładu dostępnej wiedzy. Autorzy badania nazywają potencjalny efekt „knowledge collapse” – załamaniem wiedzy. Nie oznacza to jednak, że takie załamanie już nastąpiło. – Widzimy, że nowsze modele generują nieco bardziej zróżnicowane odpowiedzi niż starsze, więc załamanie wiedzy jeszcze się nie dokonuje – zaznacza Isabelle Augenstein. – Ale mechanizm, który w dłuższej perspektywie mógłby do niego doprowadzić, już istnieje.
Sam problem trenowania kolejnych generacji modeli na treściach syntetycznych jest przedmiotem szerszych badań nad tzw. model collapse. Inne prace pokazują, że niekontrolowane wykorzystywanie treści maszynowych może zmniejszać różnorodność i pogarszać jakość modeli, choć odpowiednia selekcja danych syntetycznych może ograniczać to ryzyko.
Problem może dotyczyć także reprezentacji różnych kultur
.Badanie nie ograniczało się do prostego porównania odpowiedzi chatbotów z wyszukiwarką. Autorzy analizowali także to, jak systemy reprezentują wiedzę odnoszącą się do konkretnych państw i kultur. Doszli do wniosku, że w przypadku informacji lokalnych odpowiedzi modeli silniej odzwierciedlają anglojęzyczny obraz świata niż perspektywę wynikającą z tekstów publikowanych w języku danego kraju.
To istotna obserwacja w świecie, w którym modele językowe stają się globalnym pośrednikiem w dostępie do informacji. Jeżeli odpowiedź na pytanie dotyczące Francji, Polski, Korei czy Argentyny jest filtrowana przede wszystkim przez anglojęzyczne zasoby, model może dostarczać poprawnych faktów, a jednocześnie pomijać część lokalnych odniesień, debat i sposobów rozumienia danego zagadnienia. W konsekwencji homogenizacja wiedzy nie musi dotyczyć wyłącznie liczby informacji. Może także oznaczać stopniowe ograniczanie różnorodności kulturowych perspektyw.
Chatbot jako początek poszukiwania, nie jego koniec
.Autorzy badania nie sugerują rezygnacji z chatbotów. Podkreślają, że podsumowania przygotowywane przez systemy AI są użyteczne właśnie dlatego, że szybko porządkują duże ilości informacji i umożliwiają użytkownikowi otrzymanie syntetycznej odpowiedzi. Problem pojawia się wtedy, gdy taka odpowiedź staje się jedynym źródłem wiedzy. Szczególne znaczenie ma to w przypadku młodszych użytkowników, dla których rozmowa z chatbotem może stawać się naturalniejszym sposobem zdobywania informacji niż wyszukiwarka, książka czy bezpośrednia lektura źródeł. – Nadal ważne jest poszukiwanie różnych źródeł, aby zrozumieć niuanse i uzyskać szerszy obraz – zaznacza prof. Augenstein. – Nie możemy uzależniać się od technologii do tego stopnia, że przestaniemy rozumieć i myśleć samodzielnie. To być może najważniejsza praktyczna konsekwencja badania.
Chatbot może doskonale sprawdzać się jako pierwszy przewodnik po zagadnieniu. Nie musi jednak zastępować kontaktu ze źródłami, różnymi autorami i konkurencyjnymi interpretacjami. Im bardziej przekonująca i kompletna wydaje się bowiem pojedyncza odpowiedź generowana przez model, tym łatwiej zapomnieć, że poza nią istnieje znacznie szerszy świat informacji.
Jak mierzyć różnorodność wiedzy AI?
.Autorzy badania nie ograniczyli się do opisania problemu. Opracowali również metodę służącą do pomiaru epistemic diversity, czyli różnorodności rzeczywistych twierdzeń pojawiających się w odpowiedziach modeli. Ma ona pozwalać twórcom systemów oceniać nie tylko dokładność, bezpieczeństwo czy płynność generowanych tekstów, ale również to, jak szeroki zakres wiedzy dany model przekazuje użytkownikowi. Badacze mają nadzieję, że różnorodność informacji stanie się jednym z parametrów uwzględnianych przy budowaniu kolejnych generacji modeli.
W świecie, w którym chatboty coraz częściej stają pomiędzy człowiekiem a ogromną częścią dostępnej wiedzy, pytanie nie brzmi już bowiem wyłącznie: czy AI udziela poprawnej odpowiedzi? Równie istotne staje się inne: jakiej części dostępnej wiedzy w tej odpowiedzi nie zobaczymy?
Jarosław Kowalski / PAP






