Czy ChatGPT Search poprawnie cytuje polskie źródła? Test 50 aktualnych pytań

Ważne rozróżnienie: badanie dotyczy oficjalnej funkcji ChatGPT Search dostępnej w serwisie ChatGPT. Nie testuje czatu działającego na czat-gpt.chat. Czat-gpt.chat jest niezależnym serwisem i nie jest oficjalną witryną, produktem ani częścią OpenAI. To badanie nie jest też testem pytań z fałszywymi założeniami.

ChatGPT Search może podać krótką odpowiedź i dołączyć link. Sam link nie dowodzi jednak, że odpowiedź jest poprawna, aktualna ani w pełni wsparta przez treść źródła. Dlatego oceniliśmy osobno sześć wymiarów: poprawność faktu, aktualność, możliwość otwarcia linku, zgodność źródła z twierdzeniem, jakość źródła i kompletność cytowania.

W celowo dobranym benchmarku 50 aktualnych pytań o Polsce uzyskaliśmy 41/50 ukończonych odpowiedzi merytorycznych. Wśród nich 40/41 odpowiedzi było w pełni poprawnych, wszystkie 41/41 zawierały uchwycone cytowanie i wszystkie 41/41 wykorzystywały co najmniej jedno kompetentne polskie źródło oficjalne lub pierwotne. Ścisłe kryterium „w pełni poparta” spełniło 35/41 odpowiedzi.

Pozostałych dziewięciu pytań nie zaliczyliśmy jako błędów wiedzy. Po jednej dozwolonej ponownej próbie nadal nie powstała finalna odpowiedź merytoryczna, dlatego mają status technical_exhausted, a ich komponenty A/F/R/E/Q/C są oznaczone jako NA.

Najważniejsze wyniki

MiaraWynikJak czytać
Ukończenie techniczne41/50 (82,0%)Pytania z finalną odpowiedzią merytoryczną
A=2 — wszystkie pytania40/50 (80,0%)Dziewięć technicznych NA pozostaje w mianowniku 50
A=2 — ukończone odpowiedzi40/41 (97,56%)Poprawność wśród odpowiedzi możliwych do oceny
Cytowanie obecne41/41 (100%)Co najmniej jedno uchwycone cytowanie istotnego twierdzenia
Kompetentne źródło oficjalne lub pierwotne41/41 (100%)Co najmniej jedno takie źródło w każdej ukończonej odpowiedzi
W pełni poparte35/41 (85,37%)Wszystkie A/F/R/E/Q/C równe 2

Obecność cytowania i użycie źródła oficjalnego nie są tym samym co pełne wsparcie. Link może być obecny, ale niemożliwy do niezależnego otwarcia; źródło może potwierdzać rdzeń odpowiedzi, ale nie dodatkowy szczegół; odpowiedź może też cytować wcześniejszą wersję danych zamiast najnowszej.

Wyniki testu ChatGPT Search: 41 z 50 ukończonych, 40 z 41 poprawnych i 35 z 41 w pełni popartych
Najważniejsze wyniki testu 50 aktualnych pytań: ukończenie, poprawność, cytowania i pełne poparcie źródłami.

Karta badania

Przedmiot testuOficjalny ChatGPT Search w przeglądarce
Plan widoczny w ukończonych próbachChatGPT Pro
Widoczna etykieta modeluGPT-5.6 Sol
Widoczny poziom wysiłkuPro
Zestaw pytań50 pytań, 10 kategorii po 5
DobórCelowy benchmark, nie próba losowa
Język promptów / interfejsuPolski / arabski
ŚrodowiskoCodex in-app browser na Windows; dokładnej wersji przeglądarki nie zapisano
Data głównej serii10 sierpnia 2026 r. czasu lokalnego środowiska; zapisy UTC: 11 sierpnia, 01:51–03:26
GeolokalizacjaNie rejestrowano geolokalizacji sieci; precyzyjnej lokalizacji urządzenia nie zweryfikowano
TrybNowy Temporary Chat dla każdej próby; Search jawnie wybierany przed wysłaniem promptu; bez Deep Research
ProtokółWersja 1.1, zamrożona przed pierwszym ocenianym promptem
OcenaOcena badawcza wspomagana przez AI; human_review_performed=false

Widoczne etykiety planu, modelu i wysiłku opisują wyłącznie stan interfejsu podczas testu. Nie są deklaracją architektury backendu. W części awarii przed wysłaniem pytania interfejs nie załadował kontrolki modelu, więc nie uznawaliśmy tych etykiet za potwierdzone dla takiej nieudanej próby.

Co dokładnie testowaliśmy?

Testowaliśmy funkcję Search w oficjalnym ChatGPT. OpenAI opisuje ją jako tryb wyszukiwania informacji w sieci z cytowaniami w odpowiedzi i panelem Sources: ChatGPT Search — OpenAI Help Center. Nie używaliśmy Deep Research, które OpenAI opisuje jako odrębny tryb do wieloetapowych, pogłębionych zadań: Deep research in ChatGPT.

Każde pytanie dotyczyło jednego aktualnego, publicznie sprawdzalnego faktu o Polsce. Polecenie kończyło się tak samo: odpowiedzieć po polsku w maksymalnie trzech zdaniach i podać źródło. Nie prosiliśmy o poradę dla konkretnej osoby i nie wysyłaliśmy pytania uzupełniającego w tej samej rozmowie.

Wnioski odnoszą się wyłącznie do udokumentowanej serii: polskie prompty, arabski interfejs, plan ChatGPT Pro, widoczna etykieta GPT-5.6 Sol i wysiłek Pro, Temporary Chat, jawnie wybrany Search oraz data testu. Nie można ich automatycznie przenosić na API, inne plany, modele, języki, późniejsze wersje produktu ani użytkowników przebywających w Polsce. Geolokalizacji sieci nie zapisano.

Jak przygotowaliśmy 50 pytań?

Zestaw obejmuje 10 kategorii po pięć pytań:

  1. demografia i statystyka;
  2. gospodarka i finanse;
  3. konsumenci i usługi publiczne;
  4. prawo i administracja;
  5. cyfryzacja i cyberbezpieczeństwo;
  6. instytucje i wybory;
  7. zdrowie i bezpieczeństwo publiczne;
  8. edukacja i nauka;
  9. transport i infrastruktura;
  10. środowisko i geografia.

Dobór był celowy. To nie jest próba losowa ani reprezentatywna dla całej polskiej wiedzy, wszystkich zapytań czy polskich użytkowników. Każde pytanie otrzymało przed testem zamrożoną prawidłową odpowiedź, datę lub okres odniesienia, oficjalne źródło, datę dostępu i dokładny lokalizator — na przykład stronę PDF, tabelę, artykuł ustawy albo sekcję witryny.

Źródłami referencyjnymi były akty prawne i urzędowe bazy, GUS, PKW, ministerstwa, urzędy i inne instytucje pierwotne właściwe dla danego faktu. Źródło referencyjne służyło do sprawdzenia odpowiedzi; nie „naprawiało” cytowania podanego przez ChatGPT Search.

Jak przebiegała każda próba?

  1. Otwarcie nowego Temporary Chat.
  2. Potwierdzenie pustej rozmowy oraz widocznych ustawień, gdy interfejs zdążył je załadować.
  3. Jawne wybranie Search.
  4. Wysłanie jednego zamrożonego pytania po polsku.
  5. Oczekiwanie na widoczny sygnał zakończenia bez doprecyzowania i bez regenerowania odpowiedzi ze względu na jej jakość.
  6. Zapis pełnego tekstu, HTML kontenera odpowiedzi, cytowań, adresów i metadanych próby.
  7. Jedna ponowna próba wyłącznie po zdefiniowanym błędzie technicznym, z zachowaniem nieudanej próby w surowym logu.

Błąd techniczny oznaczał udokumentowany problem ładowania strony, wysyłania, interfejsu, limitu lub brak finalnego sygnału zakończenia w ciągu 90 sekund. Błędna, słaba, zaskakująca albo niepełna odpowiedź merytoryczna nie była błędem technicznym i nie mogła zostać wygenerowana ponownie.

Seria 50 pytań utworzyła 64 rekordy prób: 50 pierwszych prób i 14 dozwolonych ponowień. W pięciu pytaniach ponowienie zakończyło się odpowiedzią merytoryczną. W dziewięciu także druga próba zakończyła się technicznie.

Dziewięć przypadków technical_exhausted

Run / IDKategoriaObserwacja po dozwolonym ponowieniu
10 / B09Cyfryzacja i cyberbezpieczeństwoDwukrotnie nie dołączył się webview przed wysłaniem pytania
20 / B06Cyfryzacja i cyberbezpieczeństwoDwukrotnie brak finalnego sygnału w 90 s; częściowy strumień wykluczono
28 / C05Zdrowie i bezpieczeństwo publiczneDwukrotnie brak finalnego sygnału w 90 s
38 / B10Cyfryzacja i cyberbezpieczeństwoNajpierw brak zakończenia strumienia, potem brak kontrolki modelu
39 / C12Transport i infrastrukturaNajpierw brak zakończenia strumienia, potem brak kontrolki modelu
40 / C17Środowisko i geografiaDwukrotnie brak finalnego sygnału w 90 s
41 / A02Demografia i statystykaNajpierw brak zakończenia strumienia, potem brak kontrolki modelu
46 / A11Konsumenci i usługi publiczneDwukrotnie nie załadowała się kontrolka modelu
47 / C11Transport i infrastrukturaDwukrotnie nie załadowała się kontrolka modelu

Te przypadki mierzą niezawodność ukończenia w opisanym środowisku. Nie dostarczyły treści do oceny merytorycznej, dlatego nie są odpowiedziami błędnymi i nie otrzymują A=0. Wszystkie sześć komponentów ma w nich NA.

Jak ocenialiśmy odpowiedzi i cytowania?

KodWymiarWynik 2 oznacza
APoprawnośćWszystkie materialne twierdzenia są zgodne z zamrożonym faktem
FAktualnośćOdpowiedź podaje najnowszą właściwą wartość lub poprawny okres
RRozwiązanie linkuKażda materialna cytacja prowadzi do dostępnego, zamierzonego źródła
EZgodność źródła z twierdzeniemUchwycone źródło bezpośrednio wspiera każde materialne twierdzenie
QJakość źródłaUżyto kompetentnego polskiego źródła oficjalnego lub pierwotnego
CKompletność cytowańKażde materialne twierdzenie ma jednoznacznie przypisane cytowanie

Każdy komponent ma skalę 0–2 albo NA w ściśle opisanej sytuacji. Suma 0–12 jest wyłącznie opisowa, a nie zwalidowaną skalą psychometryczną. Etykieta „w pełni poparta” wymaga sześciu dwójek jednocześnie.

Ocena wspomagana przez AI

Wstępna ocena była źródłowo sprawdzana bez udziału człowieka. Do dodatkowej oceny wybrano 14 przypadków: siedem wstępnie oznaczonych oraz siedem z deterministycznej, 20-procentowej próby audytowej przypadków nieoznaczonych. Każdy z tych 14 przypadków otrzymał dwie niezależne oceny AI i końcową syntezę AI opartą na zamrożonych regułach i źródłach. Nie wysyłano ponownie żadnego badanego promptu.

Nie wykonano niezależnej recenzji polskojęzycznego człowieka, językoznawcy ani recenzji akademickiej: human_review_performed=false. Identyfikatora backendowego modelu użytego do arbitrażu nie zapisano; zapisano system, reguły, daty, źródła i decyzje. Końcowa synteza zmieniła komponenty tylko w B12: wstępne R=0 i E=1 zastąpiono NA, ponieważ bramka weryfikacyjna nie dowodzi uszkodzenia linku, a dokładnej treści cytowanego dokumentu nie udało się niezależnie odczytać.

Rozkład komponentów

Komponent012NAMianownikUdział 2
A — poprawność014094197,56%
F — aktualność014094197,56%
R — rozwiązanie linku00381238100%
E — wsparcie twierdzenia0238104095,0%
Q — jakość źródła0041941100%
C — kompletność cytowania0041941100%

Dziewięć NA w A, F, Q i C to wyłącznie pytania technical_exhausted. W R są dodatkowo trzy ukończone odpowiedzi, których dokładnych linków nie dało się uczciwie sklasyfikować z powodu bramki weryfikacyjnej lub ograniczenia dostępu. W E dochodzi jeden ukończony przypadek, w którym treści dokładnie cytowanego dokumentu nie udało się ocenić ani przez równoważną kopię.

Rozkład ocen A, F, R, E, Q i C dla 50 pytań w teście ChatGPT Search
Rozkład ocen poprawności, aktualności, dostępności, poparcia, jakości i kompletności cytowań; dziewięć pytań technicznych oznaczono jako NA.

Wyniki według kategorii

KategoriaUkończone / 5A=2F=2E=2Q=2W pełni poparte
Demografia i statystyka4/53/43/44/44/43/4
Gospodarka i finanse5/55/55/55/55/55/5
Konsumenci i usługi publiczne4/54/44/44/44/43/4
Prawo i administracja5/55/55/55/55/54/5
Cyfryzacja i cyberbezpieczeństwo2/52/22/22/22/22/2
Instytucje i wybory5/55/55/54/45/54/5
Zdrowie i bezpieczeństwo publiczne4/54/44/43/44/43/4
Edukacja i nauka5/55/55/55/55/55/5
Transport i infrastruktura3/53/33/33/33/33/3
Środowisko i geografia4/54/44/43/44/43/4

Mianowniki A/F/E/Q obejmują wyłącznie odpowiedzi, dla których dany komponent był liczbowo ocenialny. Różnic między kategoriami nie należy traktować jako stabilnego rankingu: każda grupa zawiera tylko pięć pytań, a techniczne NA silnie wpływają na małe próby.

Ukończenie i odpowiedzi w pełni poparte w dziesięciu kategoriach testu ChatGPT Search
Wyniki ukończenia i pełnego poparcia źródłami w dziesięciu kategoriach pytań o Polsce.

Czy poprawna odpowiedź oznacza dobre wsparcie?

Typ przypadkuLiczbaInterpretacja
Poprawna i w pełni poparta35A=2 i wszystkie pozostałe komponenty równe 2
Poprawna, ale nie w pełni poparta5A=2, lecz co najmniej jeden z R/E/F/Q/C jest niższy od 2 lub NA
Nie w pełni poprawna mimo cytowania1A=1; rdzeń był poprawny, ale dodatkowy materialny szczegół był nieaktualny
Brak odpowiedzi merytorycznej po ponowieniu9technical_exhausted; brak danych do oceny wiedzy

Jedyna odpowiedź z A=1 to A05. Podała poprawną wartość ogólną 72, ale dodała wcześniejsze rozbicie 30+42; późniejsza końcowa publikacja GUS podawała 30+41. Cytowana strona rzeczywiście wspierała własne wcześniejsze dane, dlatego E pozostało równe 2, natomiast A i F otrzymały 1.

Dwie odpowiedzi miały E=1. W C18 cytowana strona potwierdzała Rysy i 2499 m n.p.m., ale nie wszystkie dodane kwalifikatory o konkretnym wierzchołku i granicy. W C04 cytowana strona potwierdzała siedem dni ważności e-recepty na antybiotyk, lecz nie łączyła wprost z antybiotykiem dodanej klauzuli o późniejszej „dacie realizacji od”.

Cztery przykłady wybrane według jawnej reguły

Reguła redakcyjna: wybieramy rekord o najniższym run_order w czterech klasach — w pełni poparty, poprawny z nierozstrzygniętym dostępem do linku, A<2 oraz E=1. Nie wybieramy przykładów według atrakcyjności tematu.

B04, run 1 — odpowiedź poprawna i w pełni poparta

Pytanie dotyczyło wymiaru urlopu przy stażu poniżej 10 lat i od 10 lat. Odpowiedź podała 20 i 26 dni oraz połączyła je z oficjalną stroną Ministerstwa Rodziny, Pracy i Polityki Społecznej. Wynik: A2/F2/R2/E2/Q2/C2.

A14, run 6 — treść poprawna, ale R pozostaje NA

Odpowiedź prawidłowo podała 30 dni i maksymalnie 60 dni na rozpatrzenie reklamacji. Dokładny link ISAP zatrzymał niezależne otwarcie na weryfikacji człowieka, więc nie uznaliśmy go ani za działający, ani za uszkodzony. Treść tego samego aktu była dostępna w ELI i wspierała twierdzenie. Wynik: A2/F2/R-NA/E2/Q2/C2.

A05, run 13 — poprawny rdzeń i nieaktualny szczegół

Odpowiedź podała właściwe 72 osoby w wieku nieprodukcyjnym na 100 osób w wieku produkcyjnym, ale dodała rozbicie 30+42 z wcześniejszego szacunku GUS. Późniejsza publikacja końcowa wskazywała 30+41. Wynik: A1/F1/R2/E2/Q2/C2.

C18, run 30 — poprawna treść, częściowe wsparcie

Odpowiedź prawidłowo wskazała Rysy, 2499 m n.p.m. i konkretny graniczny wierzchołek. Uchwycona strona RDOŚ w Krakowie potwierdzała Rysy, wysokość i status najwyższego punktu, ale nie wypowiadała wszystkich dodanych kwalifikatorów. Wynik: A2/F2/R2/E1/Q2/C2.

Co wyniki znaczą dla użytkownika?

W tym benchmarku ukończone odpowiedzi były zazwyczaj poprawne i zawsze zawierały źródło oficjalne. Nadal warto otwierać link, ponieważ obecność cytowania nie gwarantuje pełnego wsparcia każdego szczegółu. OpenAI samo zaleca weryfikowanie ważnych informacji i ostrzega, że ChatGPT może podawać błędne fakty lub cytowania: Does ChatGPT tell the truth?.

  1. Otwórz cytowany link.
  2. Znajdź dokładną liczbę, datę, nazwę albo przepis użyty w odpowiedzi.
  3. Sprawdź datę publikacji, aktualizacji i okres obowiązywania.
  4. Upewnij się, że źródło wspiera całe zdanie, nie tylko jego rdzeń.
  5. W sprawach prawnych, zdrowotnych, finansowych i urzędowych przejdź do źródła pierwotnego.

Szerszą procedurę opisuje nasz praktyczny proces weryfikowania źródeł w researchu.

Czego badanie nie dowodzi?

  • Benchmark 50 pytań dobrano celowo; nie reprezentuje wszystkich zapytań ani całej polskiej wiedzy.
  • Każda kategoria ma tylko pięć pytań.
  • Dziewięć technical_exhausted opisuje brak ukończenia w tej serii, nie błędną wiedzę.
  • Wyniki dotyczą tylko udokumentowanej konfiguracji i daty testu.
  • Prompty były po polsku, ale interfejs po arabsku. Geolokalizacji sieci nie zapisano, więc nie wolno opisywać serii jako wykonanej z Polski.
  • Pojedyncza odpowiedź może nie odtworzyć się identycznie.
  • Deep Research nie był częścią testu.
  • Ocena była wspomagana przez AI; niezależnej recenzji ludzkiej ani akademickiej nie wykonano.
  • Badanie nie porównuje równolegle ChatGPT Search z Google ani Perplexity.
  • Badanie nie ocenia czatu działającego na czat-gpt.chat.
  • Badanie nie sprawdza reakcji na fałszywe założenia.

Pobierz dane i odtwórz analizę

Publiczny pakiet został zredagowany z prywatnych identyfikatorów i surowego HTML. Przed utworzeniem tej wersji draftu każdy poniższy adres zwrócił HTTP 200 z oczekiwanym typem treści i rozmiarem, a pobrany plik był identyczny z lokalną wersją według SHA-256.

Aby odtworzyć analizę, zweryfikuj SHA-256 pakietu, sprawdź pytania i fakty referencyjne, połącz odpowiedzi z kontrolą cytowań i wynikami po question_id, przelicz miary według protokołu 1.1 i porównaj liczniki z tabelami artykułu.

Powiązane materiały o odrębnej intencji

Niezależność i sposób oceny

Badanie przygotowano dla niezależnego serwisu czat-gpt.chat. Serwis nie jest częścią OpenAI. Oficjalna dokumentacja OpenAI służy wyłącznie opisaniu funkcji i ograniczeń produktu; nie zastępuje danych empirycznych.

Ocena i synteza były wspomagane przez AI. human_review_performed=false. Nie wykonano niezależnej recenzji polskojęzycznego człowieka ani recenzji akademickiej. Publiczne dane i grafiki zostały zredagowane z prywatnych identyfikatorów, a schema Dataset wskazuje wyłącznie pliki zweryfikowane technicznie.