Najnowsze możliwości AI w porównaniu z ludźmi

Jak inteligentne są najnowsze modele AI w porównaniu z ludźmi? Przyjrzyjmy się, jak najbardziej zaawansowane systemy AI wypadają na tle człowieka w różnych dziedzinach. Poniższa lista jest regularnie aktualizowana, aby odzwierciedlać najnowsze osiągnięcia.

Ostatnia aktualizacja: 28.06.2025


Ponadludzkie (lepsze niż wszyscy ludzie)

  • Gry: W wielu grach (szachy, Go, StarCraft, Dota, Gran Turismo itp.) najlepsza AI jest lepsza od najlepszego człowieka.
  • Pamięć robocza: Przeciętny człowiek potrafi zapamiętać jednocześnie około 7 elementów (np. cyfr). Gemini 1.5 Pro potrafi przeczytać i zapamiętać 99% z 7 milionów słów.
  • Szybkość czytania: Model taki jak Gemini 1.5 Pro potrafi przeczytać całą książkę w 30 sekund. Potrafi nauczyć się zupełnie nowego języka i tłumaczyć teksty w pół minuty.
  • Szybkość pisania: Modele AI potrafią pisać znacznie szybciej niż jakikolwiek człowiek, tworząc całe programy komputerowe w kilka sekund.
  • Zakres wiedzy: Współczesne duże modele językowe (LLM) wiedzą znacznie więcej niż jakikolwiek człowiek — ich wiedza obejmuje praktycznie każdą dziedzinę. Nie istnieje człowiek o porównywalnej szerokości wiedzy.

Lepsze niż większość ludzi

  • Programowanie: o3 pokonuje 99,9% ludzkich programistów w niezwykle wymagającym konkursie Codeforces. Rozwiązuje 71,7% problemów programistycznych w benchmarku SWE, co pokazuje, że skutecznie radzi sobie również z rzeczywistymi problemami inżynierii oprogramowania.
  • Pisanie: W grudniu 2023 roku powieść napisana przy pomocy AI zdobyła nagrodę na krajowym konkursie science fiction. Profesor, który korzystał z AI, stworzył narrację na podstawie szkicu liczącego 43 000 znaków, wygenerowanego w zaledwie trzy godziny przy użyciu 66 promptów. Najlepsze modele językowe dysponują nadludzkim słownictwem i potrafią pisać w wielu różnych stylach.
  • Tłumaczenie: Modele potrafią odpowiadać i tłumaczyć płynnie na wszystkie główne języki świata.
  • Kreatywność: Lepsze niż 99% ludzi w Testach Twórczego Myślenia Torrance'a, w których trzeba generować trafne i użyteczne pomysły. Testy były jednak stosunkowo niewielkie, a w przypadku większych projektów (np. zakładanie nowej firmy) AI nie jest jeszcze wystarczająco autonomiczne.
  • Wiedza ekspercka: o3 poprawnie odpowiada na 87,7% pytań z benchmarku GPQA Diamond, przewyższając ludzkich ekspertów dziedzinowych (doktorów), którzy uzyskują wynik 69,7%.
  • Rozumowanie wizualne: o3 uzyskał wynik 87,5% w benchmarku ARC-AGI (średnia ludzka to 60%), który został zaprojektowany specjalnie jako trudny dla dużych modeli językowych.
  • Matematyka: Gemini 2.5 Pro zdobył złoty medal na Międzynarodowej Olimpiadzie Matematycznej — najbardziej prestiżowym konkursie matematycznym na świecie.
  • Perswazja: GPT-4 z dostępem do danych osobowych potrafił zwiększyć zgodność uczestników z argumentami oponentów o imponujące 81,7 procent w porównaniu z debatami między ludźmi — był niemal dwukrotnie bardziej przekonujący niż ludzcy debatanci.
  • Testy IQ: W testach IQ opartych na słowach LLM-y od dłuższego czasu przewyższają od 95 do 99% ludzi (wynik od 125 do 155). W testach niewerbalnych (dopasowywanie wzorców) model o1-preview z 2024 roku uzyskał 120 punktów w teście Mensy, pokonując 91% ludzi.
  • Wiedza specjalistyczna: GPT-4 uzyskuje 75% w Medical Knowledge Self-Assessment Program, podczas gdy ludzie uzyskują średnio od 65 do 75%. Na egzaminie adwokackim (bar exam) wypada lepiej niż 68 do 90% studentów prawa.
  • Sztuka: Modele generujące obrazy wygrywały konkursy artystyczne a nawet fotograficzne.
  • Badania naukowe: GPT-4 potrafi prowadzić autonomiczne badania chemiczne, a DeepMind zbudował AI, które znalazło rozwiązanie otwartego problemu matematycznego. Jednak te architektury wymagają dużego nakładu ludzkiej inżynierii i nie są ogólne.
  • Hacking: GPT-4 potrafi samodzielnie hakować strony internetowe i pokonuje 89% hakerów w konkursie Capture-the-Flag.
  • Korzystanie z przeglądarki internetowej: Gemini 2.0 osiągnął 84% w benchmarku WebVoyager, przewyższając ludzi (72%).
  • Udawanie człowieka w czacie: GPT-4.5 zdał test Turinga i częściej był uznawany za człowieka niż rzeczywiści ludzie.

Gorsze niż większość ludzi

  • Mówienie „nie wiem": Praktycznie wszystkie duże modele językowe mają problem z „halucynacjami" — wymyślają informacje zamiast przyznać, że czegoś nie wiedzą. Może się to wydawać stosunkowo niewielką wadą, ale jest to bardzo istotne ograniczenie. Sprawia, że LLM-y są niewiarygodne i poważnie ogranicza ich zastosowanie. Jednak badania pokazują, że większe modele halucynują znacznie rzadziej niż mniejsze.
  • Zręczność ruchowa: Żaden robot nie potrafi poruszać się tak jak człowiek, ale zbliżamy się do tego. Robot Atlas potrafi chodzić, rzucać przedmiotami i wykonywać salta. Google RT-2 potrafi przekładać cele na działania w rzeczywistym świecie, np. „przesuń kubek do butelki wina". Robot Optimus Tesli potrafi składać ubrania, a dwunożny robot Figure potrafi parzyć kawę.
  • Samoreplikacja: Wszystkie formy życia na Ziemi potrafią się replikować. Modele AI mogłyby rozprzestrzeniać się z komputera na komputer przez internet, ale wymaga to zestawu umiejętności, których modele AI jeszcze nie posiadają. Badanie z 2023 roku wymienia 12 zadań wymaganych do samoreplikacji, z których testowane modele ukończyły 4. W grudniu 2024 roku badanie wykazało, że różne modele open source potrafią się samoreplikować na maszynie przy odpowiednich narzędziach. W badaniu z 2025 roku Claude 3.7 Sonnet uzyskał wynik powyżej 50% w 15 z 20 zadań samoreplikacji. AI, które skutecznie się samoreplikuje, może doprowadzić do przejęcia kontroli przez AI.
  • Ciągłe uczenie się: Obecne najnowocześniejsze LLM-y rozdzielają uczenie się („trening") od działania („wnioskowanie"). Chociaż LLM-y mogą uczyć się w ramach swojego kontekstu, nie mogą aktualizować swoich wag podczas użytkowania. Ludzie uczą się i działają jednocześnie. Istnieje jednak wiele potencjalnych podejść do rozwiązania tego problemu. Badanie z 2024 roku opisało kilka najnowszych metod ciągłego uczenia się w LLM-ach.
  • Planowanie: LLM-y nie radzą sobie jeszcze zbyt dobrze z planowaniem (np. rozumowaniem o układaniu klocków na stole). Jednak większe modele radzą sobie znacznie lepiej niż mniejsze.

Punkt docelowy

W miarę upływu czasu i poprawy możliwości, elementy z niższych sekcji przesuwają się do górnej. Kiedy zostaną osiągnięte pewne konkretne niebezpieczne zdolności, AI będzie stwarzać nowe zagrożenia. W pewnym momencie AI przewyższy każdego człowieka w każdej wyobrażalnej metryce. Gdy zbudujemy taką superinteligencję, prawdopodobnie wkrótce zginiemy. Wprowadźmy pauzę, aby upewnić się, że do tego nie dojdzie.


Źródło: pauseai.info/sota · Licencja: CC-BY 4.0