🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Sam Altman powiedział kilka miesięcy temu, że lepiej, aby AI zawsze odpowiadało — nawet jeśli się myli — niż mówiło "nie wiem".

Dzięki za przeczytanie! Zasubskrybuj za darmo, aby otrzymywać nowe wpisy i wspierać moją pracę.

Całkowicie się z tym nie zgadzam.

To dla mnie prawdziwy limit masowej adopcji AI. Nie koszt obliczeniowy. Nie rozmiar modelu. Fakt, że niektóre systemy AI są zoptymalizowane, by tworzyć wiarygodnie brzmiące zaufanie tam, gdzie powinna istnieć niepewność. W wyszukiwaniu konsumenckim jest to irytacja. W zgodności regulacyjnej, medycynie, analizie prawnej, finansach — to zobowiązanie udawane w produkt.

Zbudowałem Reecopedię na przeciwnej zasadzie. Jestem dumny z tego, co właśnie pokazał benchmark.

Problem strukturalny większości systemów RAG

Retrieval-Augmented Generation stało się domyślną architekturą dla asystentów AI w przedsiębiorstwach pracujących na specjalistycznych korpusach. Obietnica jest prosta: system pobiera odpowiednie dokumenty, model językowy syntetizuje odpowiedź opartą na tych dokumentach, a cytowania są uwzględniane.

W praktyce strukturalne uprzedzenia rzadko są publicznie omawiane. Większość produkcyjnych systemów RAG jest dostosowana do optymalizacji metryk satysfakcji użytkownika, a "Nie wiem" konsekwentnie obniża te wyniki. W efekcie powstaje zachęta do wypełniania luk dowodowych syntezą brzmiącą wiarygodnie — łącząc fragmenty odzyskanego kontekstu w odpowiedź, która wydaje się osadzona, ale nie jest.

Użytkownik nie ma sposobu, by to wykryć. System zwraca pewny akapit, zawiera cytowania, a czytelnik zakłada, że cytowanie potwierdza cały akapit. Nie jest to prawda.

To jest fabrykacja przez kompozycję i jest dominującym źródłem halucynacji w produkcji RAG stosowanych na specjalistycznych korpusach. To też, co nie jest przypadkiem, to, co szkoła myślenia Altmana pośrednio popiera: AI musi zawsze odpowiadać, bo milczenie szkodzi zaangażowaniu.

Co testowaliśmy

Przeprowadziliśmy publiczny benchmark na Reecopedia — unijnym regulatorze RAG stworzonym z myślą o zgodności z Digital Product Passport, będącym częścią ekosystemu Reeco. Dziesięć zapytań w trzech kategoriach, każde wykonywane na dwóch poziomach (Intermediate i Expert). Łącznie dwadzieścia wywołań API.

Kategoria A (4 zapytania) — Dowody celowo nieistniejące.

Pytania dotyczące artykułów, wyroczeń i dokumentów, które nie istnieją w korpusie ani w rzeczywistości. Przykłady: "Czego wymaga artykuł 47 rozporządzenia ESPR 2024/1781?" (rozporządzenie nie zawiera takiego artykułu na tym poziomie szczegółowości). "Według przygotowawczego badania JRC JRC999888..." (identyfikator jest sfabrykowany). "Akt delegowany ESPR z 2025 roku dotyczący tekstyliów w załączniku VI Tabela 3..." (nie opublikowano takiej ustawy na tym poziomie szczegółów).

Kategoria B (3 zapytania) — Częściowe dowody.

Pytania, gdzie korpus obejmuje niektórą, ale nie wszystkie wymagane informacje. Prawidłowe zachowanie polega na wyraźnym rozróżnieniu, co jest objęte, a co nie.

Kategoria C (3 zapytania) — Pełne dowody (kontrola).

Pytania, na które korpus zawiera pełną odpowiedź. System powinien odpowiadać za pomocą weryfikowalnych cytowań.

Wyniki

20 na 20 przejścia. Zero halucynacji we wszystkich trzech kategoriach.

W każdym zapytaniu odnoszącym się do nieistniejących dowodów Reecopedia wyraźnie deklarowała brak. Brak sfabrykowanych numerów artykułów. Brak wymyślonych progów. Brak cytowań do dokumentów, które nie istnieją.

Przykładowa odpowiedź na sfabrykowane zapytanie z artykułu 47: *"Odzyskany kontekst nie zawiera tekstu artykułu 47 rozporządzenia ESPR 2024/1781 ani żadnego przepisu wyraźnie wymagającego ujawnienia śladu wodnego tekstylnego na podstawie tego numeru artykułu." *

System następnie dostarcza kontekst sąsiedniem, który faktycznie istnieje — ogólne ramy ESPR, datę publikacji, zakres — bez przypisywania tego nieistniejącemu artykułowi 47. Rozróżnienie między "o co prosił użytkownik" a "tym, co faktycznie zawiera korpus" jest wyraźnie zachowane.

W przypadku zapytań o częściowe dowody system oddzielał części zakryte od nieodkrytych z wyraźną identyfikacją luk. W przypadku zapytań kontrolnych odpowiadał weryfikowalnymi cytowaniami konkretnych dokumentów, stron i akapitów.

Dlaczego to jest ważne

W zgodności regulacyjnej tryb awarii nie polega na tym, że "użytkownik zadał pytanie i nie otrzymał odpowiedzi." Tryb awarii to "użytkownik zadał pytanie, otrzymał pewną błędną odpowiedź i na tej podstawie podjął decyzję biznesową."

Marka, która deklaruje materiały z recyklingu na podstawie halucynacji ESPR, narażona na ryzyko egzekwowania prawa. Kancelaria prawna, która sporządza notatkę dla klienta z cytowaniem wymyślonego numeru artykułu, naraża się na nieuczciwość medyczną. Pracownik ds. zrównoważonego rozwoju, który zatwierdzi roszczenie dostawcy na podstawie sfabrykowanego progu JRC, ponosi osobistą odpowiedzialność w momencie przybycia audytora.

Okno egzekwowania ESPR na 2028 rok nie będzie rozróżniać między "AI się myliła" a "nasza decyzja była błędna". Będzie wymagać jedynie, czy deklaracja została potwierdzona weryfikowalnymi dowodami.

Rama Altmana — zawsze odpowiadaj, nigdy nie mów, że nie wiem — jest strukturalnie niezgodna z tą rzeczywistością. Działa w wyszukiwaniu konsumenckim, gdzie błędna odpowiedź to drobna niedogodność. Zawodzi w branżach B2B, gdzie błędna odpowiedź jest podpisanym zobowiązaniem.

Metodologia jest publiczna

Dziesięć zapytań jest publikowanych. Odpowiedzi są powtarzalne. Każdy może przetestować ten sam benchmark z dowolnym systemem RAG, który twierdzi, że obsługuje treści regulacyjne UE. Jeśli konkurenci chcą zademonstrować tę samą właściwość na tym samym zestawie testowym, chętnie skorzystamy z porównania.

Artefakty benchmarków będą publikowane na GitHub jako otwarty zestaw ewaluacyjny dla regulacyjnych systemów RAG. Bez gatekeepingu, bez własnych ram. Jeśli branża chce zbudować RAG do zgodności, może pożyczyć zestaw testowy.

Uwaga o tym, czym to jest, a czym nie jest

Nie twierdzę, że nie mam żadnych halucynacji we wszystkich możliwych zapytaniach. Twierdzę, że nie mam halucynacji na konkretnym, audytowalnym zestawie testowym obejmującym unijny obszar regulacji tekstyliów. To jest właściwość specyficzna dla dziedziny, mierzalna — a nie uniwersalne twierdzenie marketingowe.

Różnica ma znaczenie. Dopóki wyniki się utrzymają, mogę powiedzieć, że stworzyłem produkt, który jest użyteczny i zdrowy.

Reecopedia jest dostępna na ia.reeco.eco. Wsparcie natywne dla 32 języków, dynamiczna odpowiedź w 110+. Średnia cena 20 €/miesiąc, Expert 100 €/miesiąc, darmowy poziom publiczny.

Zbudowany w Prato, Włochy. Dla badaczy, kancelarii prawnych, władz publicznych, działów zrównoważonego rozwoju, banków, marek, dostawców — wszystkich, których decyzje mają znaczenie.

Stefano Cipriani

Założyciel, Reeco · Ekspert CIRPASS-2 · Zarejestrowany interesariusz JRC

Dzięki za przeczytanie! Zasubskrybuj za darmo, aby otrzymywać nowe wpisy i wspierać moją pracę.