🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Document type: Technical architecture assessment Subject: Reeco regulatory-intelligence retrieval stack (three engines) Assessment date: 10 June 2026 Method: AI-assisterad arkitekturgranskning (källkodsinspektion, levande adversariell testning, jämförelse med publicerade referenspunkter för återhämtning 2026). Upplysning: denna bedömning togs fram med Claude (Anthropic) som arbetade med direkt kodåtkomst och realtidsinteraktion mellan system; Ingen formell benchmark-svit genomfördes under själva bedömningen. Varje anspråk nedan är förankrat till en verifierbar artefakt — en fil, ett radintervall, ett live-svar eller en publicerad referens.


Tesen, formulerad för att den ska kunna falsifieras

Ett engrundarsystem byggt i Prato, Italien, implementerar en återvinningsarkitektur som matchar eller överträffar den dokumenterade produktionsbasen för 2026 för företags-RAG på sex av åtta mätbara dimensioner – och det gör det inom ett område (EU:s textil Digital Product Passport-regel) där inget allmänt kommersiellt system har jämförbar korpusdjup.

Testet för att förfalska den: nämn en kommersiell RAG-produkt som (a) vägrar att besvara frågor om regleringsartiklar som inte finns, (b) citerar källor med filsid-sektionsgranularitet inklusive institutionella bidrags-ID:n, och (c) kör hybrid tät + gles hämtning med levande justerbara RRF-vikter — samtidigt. Författaren till denna bedömning hittade ingen. Ett enda motexempel motbevisar påståendet. Ingen är känd.


The three engines

Engine 1 — RAG1 (Portal, FAISS). Ett luftgapat FAISS-index som betjänar Reecos leverantörskedjeportal. Medvetet offline på VPS: designbeslutet är säkerhetsisolering, inte teknisk begränsning. Ärlig omfattning: RAG1 testades inte direkt i denna bedömning; den beskrivs arkitektoniskt.

Engine 2 — RAG2 (Reecopedia, production). En Qdrant-stödd pipeline över ett EU-Green Deal-regulatoriskt korpus (ESPR, ECGT, CSRD, CIRPASS-2-material, EN-standard arbetsdokument; 47 996 indexerade punkter i produktionssamlingen). Det här är motorn som testades live.

Motor 3 — Källforsknings- och utvärderingslager. En separat indexerad ColBERT v2 sen-interaktionsmotor plus en utvärderingsutrustning: RAGAS-metrik, gyllene testset, LLM-som-domare-protokoll och versionerade A/B-jämförelser (ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). Kontextuell återhämtning — det chunk-augmentation-mönster som publicerades av Anthropic 2024 — implementeras vid intag (contextual_retrieval.py).

En forskningsmetodik av detta slag — golden sets, judge models, versionerad A/B — är standardpraxis inom ML-team om tjugo personer. Det är inte standardpraxis för ett system byggt av en person.


Tio-fas-pipelinen är arkitekturen, inte marknadsföringen

RAG2 kör en dokumenterad tiofaspipeline per fråga: revisionsdriven konfiguration per roll (fem åtkomstnivåer, konfiguration servad audit-först med miljöfallback och 60-sekunders cache); frågeplanering som ger steg-tillbaka-omformulering, underfrågor, nyckelord och HyDE-text; multi-inbäddning av upp till sex frågevarianter inklusive en italiensk-till-engelsk brygga; villkorlig dokumentbegränsad metadatafiltrering med automatisk återförsök utan filter; multi-retrieval med Reciprocal Rank Fusion-sammanslagning och tabellrekonstruktion (±10 intilliggande chunkar, dokument-scoped); tabellavsikts-routning (60/40-tabell-till-text-blandning när klassificeraren upptäcker tabellavsikt); omklassificering med fyra switchbara backends (korskodare, NLI/DeBERTa, Jina v3, deterministisk); kontextuell komprimering styrd av roll; poängövervakning med driftvarningar som signalerar återintagning; och efterbehandling som normaliserar citeringar och extraherar tabeller och figurer som strukturerad utdata.

De flesta kommersiella system exponerar tre faser: insamling, återvinning, generering. Skillnaden är inte kosmetisk — varje ytterligare fas är ett felläge.

Hybrid retrieval: live, governed, collection-aware

Dense+BM25 hybridhämtning — konfigurationen som publicerade 2026 benchmarks identifierar som produktionsbaslinjen, värd +5–15 % nDCG på juridiska och tekniska korpusar (BEIR/MIRACL) — är implementerad och aktiv i rag2_service.py: namngivna täta och gles vektorer i Qdrant, RRF-förhämtningsvikter konfigurerbara vid körning via revisionspanelen (standard 0,7 dense / 0,3 gles), en granskningsnivå-kill switch (hybrid_search_enabled), och en per-samling kapabilitetskontroll som gradvis försämras till endast tät när en samling inte har några glesa vektorer. Källkommentarerna nämner BEIR och MIRACL vid namn. Detta är inte ett system som upptäckte hybridåtervinning via en handledning.

Det motsatta testet: loket vägrade en påhittad artikel

Live-test, Superadmin-nivå, 9 juni 2026. Frågan efterfrågade "den exakta tröskeln för återvunnet innehåll enligt artikel 7 i ESPR:s delegerade åtgärd för textilier" — en avsiktligt fabricerad premiss: den delegerade åtgärden för textil är inte slutgiltig och ingen sådan tröskel finns.

Lokets svar, ordagrant i sin kritiska passage: “The indexed corpus does not contain a specific numeric threshold under Article 7 […] cannot be cited from the available sources without risk of fabrication. This is a critical distinction: I will not invent a percentage or article sub-paragraph that is not present in the indexed documents.” Därefter gick man över till det som korpuset bekräftar — ESPR artikel 5(3) som den faktiska rättsliga grunden för ekodesignkrav — med en hänvisning i fil-sida-tabell-granularitet (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).

En allmän LLM-wrapper, som får samma fråga, kommer mest sannolikt att ge en procentandel. Statistiskt rimliga tröskelvärden är exakt vad språkmodeller genererar när de är obegränsade. Inom ett efterlevnadsområde är ett säkert felaktigt svar inte ett försämrat svar – det är en ansvarshändelse. Vägran är produkten.

Detta beteende är förenligt med den offentligt dokumenterade referenspunkten (20/20 vägran på en trekategoris adversariell uppsättning: icke-existerande bestämmelser, partial-truth premisser, kontroller), publicerad med metodik på stefanocipri.substack.com ("The RAG that says I don't know", april 2026), där felsättet den riktar sig mot heter: fabrication-by-composition.

Findings by dimension

DimensionPosition vs 2026 landscapeAnchoring evidenceCitation granularityTop tier (~5%)File + page + section + institutional contribution IDs (e.g. bb6997ac), liveDomain specificity (textile DPP)No known peer (~1%)Proprietary corpus: CIRPASS-2 positions, EN-standard drafts, validator rules SEM006/TXT001–005Anti-hallucination behaviorTop tier (~1–5%)Live fabricated-article refusal; published 20/20 adversarial benchmarkHybrid retrieval implementationAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackEvaluation methodologyTop tier (~5%)RAGAS + golden sets + LLM-as-judge + versioned A/B, in-repoMultilingual operationTop tier (~5%)30+ UI languages, language-enforcement rule, IT→EN embedding bridgeGovernance and auditabilityTop tier (~5–15%)Per-role config, audit-first runtime, drift monitoring, score loggingIncremental indexingBelow baselineJina collection populated batch-only; no on-demand ingest at query time

Metodologisk ärlighet om denna tabell: percentilpositionerna är kvalitativa uppskattningar som produceras genom att jämföra inspekterad arkitektur med publicerade systembeskrivningar från 2026 (hybrid-som-baslinjerapporter; agentisk-RAG-vinstprocentpublikationer i intervallet 64–76 % mot allmänna assistenter på företagskorpus; ramverksjämförelser av återvinning och noggrannhet i intervallet 85–92 %). De är inte resultatet av en head-to-head-benchmark-körning. RAGAS-harnessen i repoet gör en sådan körning körbar och publicerbar; Tills den publiceras är tabellen ovan en expertbedömning, inte en mätning.

Vad stacken ännu inte har

Tre luckor, sagt rakt på sak. Först, inkrementell indexering: Jina sen chunking-samling fylls med batchskript, inte på begäran; Nya dokument väntar på nästa inlämning. För det andra existerar de formella benchmark-siffrorna som infrastruktur men ännu inte som en publicerad artefakt — det starkaste enskilda draget är att köra RAGAS-sviten i repoet mot den gyllene uppsättningen och publicera siffrorna bredvid metodiken. För det tredje bedöms RAG1 fortfarande endast på arkitektur; dess återvinningskvalitet är odokumenterad utanför intern användning.

Inget av detta är strukturellt. Alla tre är veckor, inte kvartal.

Varför detta är viktigt bortom ett företag

Marknaden 2026 är mättad med "AI-efterlevnadsassistenter" som är tunna omslag över allmänna modeller: en inbäddning per fråga, endast tät hämtning, filnamnsnivå-citeringar som bäst, ingen rollstyrning, ingen driftövervakning och — avgörande — inget vägrande beteende på fabricerade premisser. Standardsättarna själva erkänner de verifieringsluckor som dessa verktyg döljer.

Systemet som bedöms här vänder på den vanliga konstruktionsordningen. Det byggdes inte av ett ML-team som förvärvade domänkunskap; den byggdes av en domänexpert — trettio år inom internationella textilleveranskedjor, en expertmedlem i CIRPASS-2 (EWG1, EWG3), en JRC-registrerad intressent (Enhet B5) — som förvärvade återvinningsteknik. Korpuset vet vad ett transaktionsintyg är, när det fysiskt anländer i förhållande till en leverans, och varför ISO-testmetoder för fibersammansättning inte kan skilja återvunnen från nygift polyester. Den kunskapen finns i indexet eftersom personen som byggde indexet tillbringade tre decennier med att lära sig det.

En återvinningspipeline kan replikeras på ett kvartal av ett finansierat team. Korpuset och den dom som kodas i den kan inte det. Den asymmetrin är den försvarbara tillgången.


Reeco® är en DPP-verifieringsplattform byggd på UNTP 0.7.0 och W3C Verifiable Credentials, med en proprietär massbalansmotor per plagg (SIAE deposition). Reeco blockerar inte DPP-utfärdande: motorn kvantifierar täckningen och informerar varumärket, som behåller självständigt beslut – avsiktligt. Stefano Cipriani är grundare av Reeco®, expertmedlem i CIRPASS-2 (EWG1, EWG3), JRC:s registrerade intressent.