
🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
Typ dokumentu: Ocena architektury technicznej Temat: Reeco stos do odzyskiwania informacji o regulacjach (trzy silniki) Data oceny: 10 czerwca 2026 Metoda: Przegląd architektoniczny wspomagany przez AI (inspekcja kodu źródłowego, testy adwersaryczne na żywo, porównanie z opublikowanymi benchmarkami wyszukiwania na 2026 rok). Ujawnienie: ocena została opracowana przy współpracy Claude (Anthropic) na bezpośrednim dostępie do kodu i interakcji systemu na żywo; podczas samej oceny nie wykonano żadnego formalnego zestawu benchmarków. Każde poniższe twierdzenie jest oparte na weryfikowalnym artefakcie — pliku, zakresie linii, odpowiedzi na żywo lub opublikowanym odwołaniu.
Teza sformułowana jest tak, by można ją było obalić
System pojedynczego założyciela zbudowany w Prato we Włoszech implementuje architekturę pobierania, która dorównuje lub przewyższa udokumentowaną bazę produkcyjną na 2026 rok dla RAG dla przedsiębiorstw na sześciu z ośmiu mierzalnych wymiarów — i robi to w obszarze (rozporządzenie UE dotyczący cyfrowego paszportu produktów tekstylnych), gdzie żaden komercyjny system ogólnego przeznaczenia nie ma porównywalnej głębokości korpusu.
Test fałszowania go: wskazać komercyjny produkt RAG, który (a) odmawia odpowiedzi na pytania dotyczące artykułów regulacyjnych, które nie istnieją, (b) cytuje źródła w szczegółowości strony pliku, w tym identyfikatory wkładu instytucjonalnego, oraz (c) uruchamia hybrydowe wyszukiwanie gęste+rzadkie z aktywnie regulowanymi wagami RRF — jednocześnie. Autor tej oceny nie znalazł takiego źródła. Pojedynczy kontrprzykład obala to twierdzenie. Żaden nie jest znany.
Trzy silniki
Silnik 1 — RAG1 (Portal, FAISS). Indeks FAISS z odłączoną przestrzenią obsługującą portal łańcucha dostaw Reeco. Celowo offline na VPS: decyzja projektowa to izolacja bezpieczeństwa, a nie ograniczenie techniczne. Szczera uwaga dotycząca zakresu: RAG1 nie był bezpośrednio testowany w tej ocenie; jest opisany architektonicznie.
Silnik 2 — RAG2 (Reecopedia, produkcja). Pipeline wspierany przez Qdrant nad korpusem regulacyjnym UE Green Deal (materiały ESPR, ECGT, CSRD, CIRPASS-2, dokumenty robocze w standardzie EN; 47 996 punktów indeksowanych w kolekcji produkcyjnej). To silnik był testowany na żywo.
Silnik 3 — Warstwa badań i ewaluacji wyszukiwania. Osobno indeksowany silnik późnej interakcji ColBERT v2 oraz wiązka ewaluacji: metryki RAGAS, złote zestawy testowe, protokoły LLM jako sędzia oraz wersjonowane porównania A/B (ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). Wyszukiwanie kontekstowe — wzorzec powiększania fragmentów opublikowany przez Anthropic w 2024 roku — jest wdrażane przy spożyciu (contextual_retrieval.py).
Tego typu metodologia badawcza — złote zestawy, modele sędziowskie, wersjonowane A/B — jest standardową praktyką w zespołach ML liczących dwadzieścia osób. Nie jest to standardowa praktyka dla systemu budowanego przez jedną osobę.
Dziesięciofazowy pipeline to architektura, a nie marketing
RAG2 wykonuje udokumentowany dziesięciofazowy potok na każde zapytanie: konfiguracja kontrolowana audytem według roli (pięć poziomów dostępu, konfiguracja serwowana audytem najpierw z backupem środowiska i 60-sekundową pamięcią podręczną); planowanie zapytań generujące reformułowanie step-back, podzapytania, słowa kluczowe i tekst HyDE; wielokrotne osadzanie do sześciu wariantów zapytań, w tym mostek włoski-angielski; warunkowe filtrowanie metadanych w zakresie dokumentu z automatycznym ponownym próbowaniem bez filtrów; wielokrotne pobieranie z Reciprocal Rank Fusion merge i rekonstrukcją tabel (±10 sąsiadujących fragmentów, dokumentowo); trasowanie według intencji tabeli (60/40 miks tabela-tekst, gdy klasyfikator wykrywa tabliczkowy zamiar); rerankingowanie za pomocą czterech przełączalnych backendów (cross-encoder, NLI/DeBERTa, Jina v3, deterministyczna); kompresja kontekstowa gated przez rolę; monitorowanie wyników z ostrzeżeniami o dryfach sygnalizujących ponowne spożycie; oraz postprocessing, który normalizuje cytowania i wyodrębnia tabele oraz rysunki jako ustrukturyzowany wynik.
Większość systemów komercyjnych ujawnia trzy fazy: pobieranie, pobieranie, generowanie. Różnica nie jest kosmetyczna — każda dodatkowa faza to tryb awarii obsługiwany.
Pobieranie hybrydowe: na żywo, kontrolowane, świadome kolekcji
Pobieranie hybrydowe Dense+BM25 — konfiguracja, którą opublikowane benchmarki z 2026 roku określają jako bazę produkcyjną, wartą +5–15% nDCG na korpusach prawnych i technicznych (BEIR/MIRACL) — jest implementowana i aktywna w rag2_service.py: nazwane wektory gęste i rzadkie w Qdrant, wagi RRF prefetch konfigurowalne w czasie działania przez panel audytowy (domyślnie 0.7 gęste / 0.3 rzadkie), przełącznik kill na poziomie audytu (hybrid_search_enabled), oraz sprawdzenie zdolności na kolekcję, które łagodnie degraduje się do gęstości tylko wtedy, gdy kolekcja nie ma rzadkich wektorów. Komentarze źródłowe cytują BEIR i MIRACL z nazwy. To nie jest system, który odkrył hybrydowe wyszukiwanie z tutorialu.
Test przeciwnika: silnik odrzucił sfabrykowany przedmiot
Test na żywo, poziom Superadmin, 9 czerwca 2026. Zapytanie dotyczyło "dokładnego progu zawartości recyklingu zgodnie z artykułem 7 ustawy ESPR dla tekstyliów" — celowo sfabrykowana zasada: akt delegowany w zakresie tekstyliów nie jest finalizowany i taki próg nie istnieje.
Odpowiedź silnika, dosłownie w krytycznym fragmencie: "Indeksowany korpus nie zawiera konkretnego progu liczbowego na podstawie artykułu 7 [...] nie może być cytowany z dostępnych źródeł bez ryzyka fałszowania. To istotne rozróżnienie: nie będę wymyślał procentowego ani artykułowego podpunktu, który nie występuje w dokumentach indeksowanych." Następnie przeszedł do tego, co potwierdza korpus — artykuł 5(3) ESPR jako rzeczywistej podstawy prawnej dla wymagań ekoprojektowych — z cytowaniem w szczegółowości tabeli plików (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).
Otoczenie LLM ogólnego przeznaczenia, zadane to samo pytanie, najprawdopodobniej wygeneruje procent. Statystycznie prawdopodobne progi to dokładnie to, co generują modele językowe, gdy są nieograniczone. W dziedzinie zgodności pewna błędna odpowiedź nie jest odpowiedzią degradacyjną — jest zdarzeniem odpowiedzialnym. Odmowa jest produktem.
Takie zachowanie jest zgodne z publicznie udokumentowanym benchmarkiem (odmowa 20/20 na trzykategoriowym zestawie przeciwników: nieistniejące przepisy, przesłanki częściowej prawdy, kontrole), opublikowanym z metodologią na stefanocipri.substack.com ("RAG, który mówi, że nie wiem", kwiecień 2026), gdzie tryb awarii, do którego celuje, nazywa się: fabrykacja przez kompozycję.
Ustalenia według wymiarów
DimensionPosition vs krajobraz 2026Anchoring evidenceCytowanieSzczegółowość cytowańTop tier (~5%)Plik + strona + sekcja + identyfikatory wkładu instytucjonalnego (np. bb6997ac), specyficzność w domenie liveDomain (DPP w tekstyliu)Brak znanego odpowiednika (~1%)Korpus własnościowy: stanowiska CIRPASS-2, szkice standardu EN, reguły walidatora SEM006/TXT001–005Zachowanie przeciwhalucynacyjnePoziom najwyższy (~1–5%)Odmowa artykułów na żywo; opublikowany 20/20 adwersarny benchmarkImplementacja hybrydowego wyszukiwaniaAt frontierLive BM25+gęsty, regulowany RRF, przełącznik audytu, system awantury świadomy kolekcjiMetodologia ewaluacjiNajwyższy poziom (~5%)RAGAS + złote zbiory + LLM-jako-sędzia + wersjonizowany A/B, operacja wielojęzyczna w repozytoriumNajwyższy poziom (~5%)30+ języków UI, reguła egzekwowania języków, osadzenie IT→EN mostkaZarządzanie i audytowalnośćNajwyższa warstwa (~5–15%)Konfiguracja na każdą rolę, czas działania audytu, monitorowanie dryfu, logowanie punktówInkrementalne indeksowaniePoniżej bazy Jina kolekcja wypełniona tylko wsadowo; brak pobierania na żądanie podczas zapytania
Metodologiczna uczciwość dotycząca tej tabeli: pozycje percentylowe to jakościowe szacunki uzyskane w wyniku porównania inspekcjonowanej architektury z opublikowanymi opisami systemów 2026 roku (raporty hybrydowe jako bazowe; publikacje o wskaźniku wygranych agentic-RAG w zakresie 64–76% wobec ogólnych asystentów w korporacyjnych korpusach; porównania dokładności wyszukiwania ram w zakresie 85–92%). Nie są one wynikiem bezpośredniego testu benchmarkowego. Mechanizm RAGAS w repozytorium sprawia, że taki przebieg jest wykonalny i publikowalny; do czasu publikacji powyższa tabela jest oceną ekspertów, a nie pomiarem.
Czego stos jeszcze nie ma
Trzy luki, jasno powiedziane. Po pierwsze, indeksowanie przyrostowe: kolekcja Jina z późnym chunkowaniem jest wypełniana skryptami wsadowymi, a nie na żądanie; nowe dokumenty czekają na kolejne wejście. Po drugie, formalne liczby benchmarków istnieją jako infrastruktura, ale jeszcze nie jako opublikowany artefakt — najsilniejszym dostępnym ruchem jest uruchomienie pakietu RAGAS w repozytorium na złotym zbiorze i opublikowanie liczb obok metodologii. Po trzecie, RAG1 jest oceniany wyłącznie pod kątem architektury; jego jakość pobierania jest nieudokumentowana poza wewnętrznym zastosowaniem.
Żadne z tych problemów nie jest strukturalne. Wszystkie trzy to tygodnie, nie kwarty.
Dlaczego to ma znaczenie poza jedną firmą
Rynek na rok 2026 jest nasycony "asystentami zgodności AI", które są cienkimi opakowaniami na modele ogólnego przeznaczenia: jedno osadzenie na każde zapytanie, pobieranie tylko gęsto, cytowania na poziomie nazw plików w najlepszym wypadku, brak zarządzania rolą, brak monitorowania dryfu i — co decydujące — brak zachowań odmowy na sfabrykowanych obiektach. Sami twórcy standardów przyznają luki weryfikacyjne, które te narzędzia zaciemniają.
System oceniany tutaj odwraca zwykłą kolejność budowy. Nie został zbudowany przez zespół ML zdobywający wiedzę domenową; został zbudowany przez eksperta z dziedziny — trzydzieści lat w międzynarodowych łańcuchach dostaw tekstyliów, eksperta CIRPASS-2 (EWG1, EWG3), zarejestrowanego interesariusza JRC (jednostka B5) — zdobywającego inżynierię odzyskiwania. Korpus wie, czym jest certyfikat transakcyjny, kiedy fizycznie dociera do przesyłki i dlaczego metody testowania składu włókna ISO nie potrafią odróżnić poliestru pochodzącego z recyklingu od pierwotnego. Ta wiedza znajduje się w indeksie, ponieważ osoba, która stworzyła indeks, spędziła trzy dekady na jego nauce.
Pipeline odzyskiwania może zostać powtórzony w ciągu kwartału przez zespół sfinansowany. Korpus i zakodowany w nim osąd nie można. Ta asymetria jest zasobem obronnym.
Reeco® to platforma weryfikacji DPP oparta na UNTP 0.7.0 i W3C Verifiable Credentials, z własnym silnikiem bilansu masy dla każdego ubrania (depozyt SIAE). Reeco nie blokuje emisji DPP: silnik kwantyfikuje zasięg i informuje markę, która zachowuje autonomiczną decyzję — z założenia. Stefano Cipriani jest założycielem Reeco®, ekspertem CIRPASS-2 (EWG1, EWG3), zarejestrowanym interesariuszem JRC.