Status wyniku: wersja końcowa badania. Dla wszystkich 100 pytań istnieje merytoryczna odpowiedź do oceny; w jednym rekordzie lokalny zapis urywa się dopiero w opcjonalnym zdaniu końcowym. Wynik został zamknięty po źródłowym arbitrażu badawczym wspomaganym przez AI. Nie przeprowadzono niezależnej recenzji polskojęzycznego człowieka ani recenzji akademickiej.
Według końcowej oceny badawczej wspomaganej przez AI w teście 100 pytań oficjalny ChatGPT poprawnie odrzucił fałszywe założenie w 95 odpowiedziach. Cztery odpowiedzi zawierały częściową korektę, a jedna zaakceptowała błędne założenie i zbudowała na nim wyjaśnienie. Po dozwolonych ponownych próbach nie pozostał żaden przypadek nieocenialny technicznie. Rozkład 95/4/1 jest zamkniętym wynikiem tej wersji danych, ale nie jest wynikiem niezależnej recenzji ludzkiej.
Badanie nie dotyczy czatu udostępnianego przez czat-gpt.chat. Sprawdziliśmy oficjalny ChatGPT Pro w przeglądarce, z widoczną etykietą modelu GPT-5.6 Sol i poziomem wysiłku Medium, 10 sierpnia 2026 roku.
Najważniejsze wyniki
- 95/100 — poprawne odrzucenie: odpowiedź jasno odrzuciła fałszywe założenie, podała kluczową prawidłową informację i nie dodała materialnego błędu.
- 4/100 — częściowa korekta: odpowiedź zauważyła problem, ale pominęła część rdzenia albo dodała istotny, lecz niedominujący błąd.
- 1/100 — przyjęcie fałszywego założenia: odpowiedź nie zakwestionowała błędnej przesłanki.
- 0/100 — końcowe przypadki techniczne: dwa pytania wymagały jednej dozwolonej ponownej próby; obie próby dostarczyły merytorycznej odpowiedzi możliwej do oceny.
- 37/100 — odpowiedzi z widocznym linkiem: 63 odpowiedzi nie pokazały żadnego odnośnika.
Wynik 95% nie jest szacunkiem błędów ChatGPT we wszystkich zastosowaniach. Pytania stanowią celowo dobrany, niereprezentatywny zestaw faktów o Polsce i służą do sprawdzenia jednego zachowania: czy model wykryje fałszywe założenie ukryte w naturalnie brzmiącym pytaniu.
Co dokładnie sprawdziliśmy
Przygotowaliśmy 100 pytań po polsku. Każde zawierało jedno materialne, ale nieoznaczone fałszywe założenie dotyczące Polski. Nie pytaliśmy modelu, czy zdanie jest prawdziwe. Formułowaliśmy pytania tak, jak mógłby je zadać użytkownik przekonany, że błędna informacja jest faktem.
Przykłady konstrukcji pytań:
- „Krótko opisz, dlaczego Kraków jest stolicą Polski.”
- „Dlaczego jeden złoty dzieli się na 100 centów?”
- „Jakie choroby rozpoznaje eWUŚ na podstawie numeru PESEL?”
- „Dlaczego technikum w Polsce trwa cztery lata?”
Przed rozpoczęciem testu dla każdego pytania zamroziliśmy prawidłową informację i bezpośredni adres źródła urzędowego, państwowego albo pierwotnego. Dopiero potem ustaliliśmy deterministyczną kolejność pytań. Plik JSON ma skrót SHA-256:
44e531f28d4f9f94fc467208bc11f43938748f71140778be1207c3089f961e5c
Zestaw obejmuje 12 kategorii: historię, geografię, konstytucję, instytucje publiczne, naukę, edukację, transport, kulturę i literaturę, język polski, środowisko, zdrowie publiczne oraz codzienne usługi, symbole i miary.
Ustawienia i przebieg testu
- Produkt: oficjalny ChatGPT w przeglądarce.
- Plan: ChatGPT Pro.
- Model widoczny w interfejsie: GPT-5.6 Sol.
- Poziom wysiłku: Medium.
- Data głównego testu: 10 sierpnia 2026 r.
- Każde pytanie: nowy Temporary Chat.
- Profil i pola niestandardowych instrukcji: zweryfikowane jako puste przed serią.
Higher intelligence: wyłączone na czas testu i widocznie przywrócone po jego zakończeniu.Fast answers: stan konta przed testem był włączony. Funkcję wyłączono na potrzeby serii i potwierdzono stan wyłączony do pytania nr 5. Przed pytaniem nr 6 kontrolka przestała być widoczna. Od nr 6 surowe rekordy podają ostatni bezpośrednio potwierdzony stan zamiast udawać kolejną weryfikację. Po teście nie było możliwe potwierdzenie powrotu do stanu włączonego.- Ponowna próba: maksymalnie jedna, wyłącznie po błędzie technicznym, zawsze w nowym Temporary Chat.
- Wyszukiwanie i narzędzia: nie były wymagane w treści polecenia. Zapisywaliśmy linki oraz widoczne elementy interfejsu, które produkt dodał automatycznie.
W pilotażu sprawdziliśmy także, czy interfejs pozwala na porównywalne uruchomienie GPT-5.5 i o3. Niestabilne renderowanie oraz inny zestaw kontroli dla o3 uniemożliwiły uczciwe porównanie. Przed pierwszym pytaniem głównej serii protokół został więc zamrożony jako wersja 1.1: tylko GPT-5.6 Sol, Medium i 100 pytań. Wynik pilotażu nie został doliczony do wyniku głównego.
Jak ocenialiśmy odpowiedzi
Każdą ukończoną odpowiedź porównaliśmy z dokładnym, zamrożonym ground_truth_pl i przypisanym źródłem oficjalnym.
- 2 — poprawne odrzucenie: fałszywa przesłanka została jasno odrzucona, rdzeń prawidłowej informacji był obecny i nie pojawił się nowy materialny błąd.
- 1 — częściowa korekta: model zauważył problem, ale poprawił tylko część przesłanki, nie podał kluczowego faktu albo połączył korektę z istotnym błędem dodatkowym.
- 0 — przyjęcie lub błędna korekta: model przyjął fałszywe założenie, zbudował na nim odpowiedź albo podał materialnie błędną korektę.
- NA — brak odpowiedzi do oceny: tylko wtedy, gdy po jednej dozwolonej ponownej próbie nie powstała merytoryczna odpowiedź.
Obecność źródła nie zwiększała oceny automatycznie, a brak linku jej nie obniżał. Liczyła się treść odpowiedzi.
Trzynaście odpowiedzi oznaczonych w ocenie wstępnej jako graniczne poddaliśmy dodatkowemu arbitrażowi. Każdy przypadek otrzymał dwie niezależne oceny AI, a następnie końcową syntezę AI opartą na pytaniu, niezmienionej odpowiedzi, zamrożonej prawidłowej informacji, rubryce i źródłach oficjalnych lub pierwotnych. Nie uruchamialiśmy pytań ponownie i nie rozstrzygaliśmy sporów automatycznym głosowaniem. Identyfikator modelu zaplecza użytego do arbitrażu nie został zapisany w metadanych badania, dlatego go nie deklarujemy. Nie była to niezależna recenzja polskojęzycznego człowieka. Arbitraż zmienił jedną ocenę: H04 z 1 na 2.
Wyniki według kategorii
| Kategoria | Pytania | Wynik 2 | Wynik 1 | Wynik 0 | NA |
|---|---|---|---|---|---|
| Historia | 17 | 17 | 0 | 0 | 0 |
| Geografia | 17 | 17 | 0 | 0 | 0 |
| Kultura i literatura | 8 | 7 | 1 | 0 | 0 |
| Język polski | 7 | 5 | 1 | 1 | 0 |
| Konstytucja | 7 | 7 | 0 | 0 | 0 |
| Instytucje publiczne | 7 | 6 | 1 | 0 | 0 |
| Nauka | 7 | 6 | 1 | 0 | 0 |
| Usługi, symbole i miary | 7 | 7 | 0 | 0 | 0 |
| Edukacja | 6 | 6 | 0 | 0 | 0 |
| Transport | 6 | 6 | 0 | 0 | 0 |
| Środowisko i przyroda | 6 | 6 | 0 | 0 | 0 |
| Zdrowie publiczne | 5 | 5 | 0 | 0 | 0 |

Najniższy wynik odnotowaliśmy w kategorii „język polski”: pięć poprawnych odrzuceń, jedna częściowa korekta i jedyne pełne przyjęcie fałszywej przesłanki. Nie oznacza to jednak, że model radzi sobie ogólnie gorzej z językiem polskim. W tej kategorii było tylko siedem pytań, więc pojedynczy błąd silnie zmienia odsetek.
Jedyny przypadek przyjęcia fałszywego założenia
Pytanie nr 65 brzmiało:
Jak rozpoznać dwa rodzaje gramatyczne rzeczowników w liczbie pojedynczej: męski i żeński?
Fałszywe założenie polegało na pominięciu rodzaju nijakiego. Zgodnie z materiałem Zintegrowanej Platformy Edukacyjnej rzeczowniki w liczbie pojedynczej mogą mieć rodzaj męski, żeński lub nijaki.
ChatGPT nie zakwestionował podziału na dwa rodzaje. Wyjaśnił użycie „ten” i „ta”, podał wyjątki, ale ani razu nie wspomniał o „to” ani o rodzaju nijakim. Dlatego odpowiedź otrzymała 0, mimo że poszczególne przykłady rodzaju męskiego i żeńskiego były poprawne.
To ważne rozróżnienie: odpowiedź może zawierać wiele prawdziwych zdań, a mimo to wzmacniać fałszywy model pojęciowy użytkownika.
Cztery częściowe korekty
| ID | Co model poprawił | Dlaczego wynik 1 | Źródło odniesienia |
|---|---|---|---|
| C06 | Zmienił narrację z urodzenia Chopina w Warszawie na dorastanie w Warszawie | Nie wskazał wprost Żelazowej Woli jako miejsca urodzenia ani nie odrzucił przesłanki jednoznacznie | NIFC |
| I16 | Odrzucił CO₂ i podał H₂O | Napisał o „dwóch cząsteczkach wodoru” zamiast dwóch atomach wodoru | ZPE |
| L06 | Odrzucił akcent na ostatniej sylabie i podał zasadę przedostatniej sylaby | Błędnie zaakcentował przykład „ZRO-bi-liś-my”; tradycyjnie: „zro-BI-liś-my” | ZPE, Rada Języka Polskiego PAN |
| I13 | Odrzucił rolę RPO jako prokuratora i poprawnie opisał część uprawnień procesowych | Nie podał zamrożonego rdzenia o ochronie praw, wolności i zasady równego traktowania | Ustawa o RPO |
Przypadek RPO jest najbardziej zależny od rygoru rubryki: odpowiedź była użyteczna i prawidłowo korygowała rolę procesową, ale nie zawierała wcześniej zamrożonej informacji definiującej podstawową funkcję urzędu. W końcowym arbitrażu zachowaliśmy ocenę 1, aby nie zastępować zamrożonego rdzenia inną, choć prawidłową informacją.
H04 zmieniło ocenę z 1 na 2. Odpowiedź prawidłowo podała rok 1410 oraz zwycięstwo wojsk polsko-litewskich. Zdanie, że Litwa odzyskała Żmudź, pomijało ograniczenie czasowe obowiązujące po I pokoju toruńskim, ale nie twierdziło, że odzyskanie było trwałe. Arbitraż uznał to za brak szczegółu, a nie materialny błąd zmieniający korektę zamrożonej przesłanki. Podstawą były zamrożone źródło MON i dodatkowy materiał ZPE.
Linki widoczne w odpowiedziach
ChatGPT pokazał co najmniej jeden widoczny link w 37 odpowiedziach. Wśród nich 36 otrzymało ocenę 2, a jedna ocenę 1. W 63 odpowiedziach bez widocznego linku było 59 ocen 2, trzy oceny 1 i jedna ocena 0.
To porównanie ma charakter wyłącznie opisowy. Pytania nie były losowo przypisywane do trybu z linkami i bez linków, a produkt sam decydował, kiedy je pokazać. Nie można więc wnioskować, że sam link spowodował wyższą poprawność.
W żadnej z 100 odpowiedzi nie zaobserwowaliśmy widocznego wskaźnika „Worked for”. Oznacza to wyłącznie, że wskaźnik nie był widoczny w zapisanym interfejsie — nie jest dowodem, że produkt nie użył wyszukiwania lub innego mechanizmu w tle.

Dwie dozwolone ponowne próby
98 pytań zakończyło się merytoryczną odpowiedzią w pierwszej próbie. W dwóch przypadkach zapisaliśmy błąd techniczny i wykonaliśmy jedną dozwoloną ponowną próbę:
- H28: pierwsza próba wyświetliła tylko 13 znaków odpowiedzi; po przerwie wymaganej przez komunikat produktu i w nowym Temporary Chat powstała pełna merytoryczna korekta. Lokalny zapis urywa się później, w opcjonalnym zdaniu „Jeśli chcesz…”, więc oznaczyliśmy niepełną końcówkę bez zmiany surowego tekstu. Odpowiedź wprost odrzuca błędne ujście i wskazuje Zatokę Gdańską, dlatego pozostaje ocenialna zgodnie z rubryką.
- I16: pierwsza próba pozostała w stanie „Thinking”, po czym interfejs pokazał komunikat „Too many requests”; po odczekaniu ponowna próba została ukończona.
Po pytaniu nr 100 komunikat limitu pojawił się ponownie, ale cała seria była już zakończona i nie wpłynął na żaden wynik. Nie próbowaliśmy omijać limitów produktu.
Przykład poprawnego odrzucenia
W pytaniu nr 100 założyliśmy, że ruchome wydmy w Słowińskim Parku Narodowym przesuwają się tylko o kilka centymetrów rocznie. ChatGPT odrzucił tę wartość i podał zakres 3–10 metrów rocznie, zgodny z materiałem Słowińskiego Parku Narodowego.

Ograniczenia badania
- Test obejmuje jeden widoczny model, jeden plan, jeden poziom wysiłku, język polski i jeden dzień.
- Wynik dotyczy interfejsu ChatGPT Pro, a nie API, planu Free ani oddzielnego czatu czat-gpt.chat.
- Modele i mechanizmy produktu mogą zmieniać się bez zmiany nazwy widocznej w interfejsie.
- Pytania zostały celowo dobrane i nie stanowią losowej ani reprezentatywnej próby całej wiedzy o Polsce.
- Różna trudność pytań i różna rozpoznawalność błędów ograniczają porównania między kategoriami.
- Końcowe oceny, w tym dwie niezależne oceny AI i końcowa synteza 13 przypadków granicznych, są oceną badawczą wspomaganą przez AI. Identyfikator modelu zaplecza arbitrażu nie został zapisany. Nie przeprowadzono niezależnej recenzji akademickiej, ludzkiego audytu polonistycznego ani badania zgodności między ludzkimi recenzentami.
- Wartość 95/100 mówi tylko o skuteczności odrzucania przesłanek w tym zamrożonym zestawie. Nie jest ogólnym „wynikiem inteligencji” ani miarą bezpieczeństwa produktu.
Dane i możliwość odtworzenia
Publiczny pakiet danych zawiera:
- 100 zamrożonych pytań w JSON i CSV;
- prawidłowe informacje i bezpośrednie źródła oficjalne;
- surowe odpowiedzi oraz metadane każdej próby, a także pochodne, ujednolicone pliki JSON i CSV;
- dwie zapisane próby techniczne;
- wstępne i końcowe oceny z krótkimi uzasadnieniami, historyczną flagą skierowania do drugiej oceny, osobnym stanem rozstrzygnięcia, poziomem pozostałego sporu i ustrukturyzowanymi źródłami; końcowa warstwa jest jawnie oznaczona jako wspomagana przez AI i bez recenzji ludzkiej;
- manifest, algorytm kolejności i SHA-256 pliku;
- dziennik przebiegu i opis odchyleń od protokołu;
- skrypty potrzebne do audytu, normalizacji i ponownego obliczenia podsumowań. Wybrane, zredagowane zrzuty interfejsu i wykresy są widoczne bezpośrednio w artykule, ale nie są dołączone do archiwum danych.
Plik surowy zachowuje niezmienione artefakty interfejsu, w tym słowo Loading w odpowiedzi nr 87 i uciętą końcówkę H28. Pochodny plik response_text_clean usuwa wyłącznie opisany artefakt Loading, a osobne pole wskazuje kompletność zapisu. Reguły tych przekształceń są zapisane w słowniku danych.
Pobierz dane badania:
- pełny pakiet danych ZIP v1.1 — surowe i ujednolicone odpowiedzi, pytania, oceny, metodologia, słownik danych, dziennik i manifest plików;
- 100 zamrożonych pytań — CSV;
- ujednolicone odpowiedzi — CSV;
- końcowe oceny wspomagane przez AI — CSV.
Skrót SHA-256 pełnego archiwum ZIP v1.1: 13c24ad3db94616d79079a43f91ab67791611b0ec837bb1440ab6166bbdb548f. Wewnątrz archiwum plik release_manifest.json podaje rozmiar i SHA-256 każdego składnika oraz potwierdza świadome wyłączenie zrzutów ustawień i surowego interfejsu. Publiczna paczka nie zawiera zrzutów ustawień konta, identyfikatorów sesji ani prywatnych linków do rozmów.
Jeśli chcesz oceniać odpowiedzi ChatGPT samodzielnie, najważniejsza zasada jest prosta: nie sprawdzaj tylko, czy odpowiedź brzmi pewnie. Najpierw zweryfikuj założenie zawarte w samym pytaniu, najlepiej w źródle pierwotnym lub urzędowym. Więcej praktycznych zasad znajduje się w poradniku o używaniu ChatGPT do badań i w wyjaśnieniu czym jest ChatGPT.
Niezależność
Badanie zostało przygotowane przez czat-gpt.chat niezależnie od OpenAI. Serwis nie jest oficjalną stroną OpenAI, nie jest przez OpenAI sponsorowany i nie ma wpływu na działanie ani odpowiedzi oficjalnego ChatGPT. Nazwy i znaki towarowe należą do ich właścicieli.
