Hoe wij meten
Technische AI-leesbaarheidsmeting — geen kwaliteitsoordeel
Deze pagina beschrijft precies wat onze AI-Readiness Score meet, hoe het gewogen wordt, en wat het uitdrukkelijk NIET is. Alle cijfers komen één-op-één uit de code (computeOverallScore8 in agenticCommerce.ts).
Belangrijk: Dit is een technische meting van AI-leesbaarheid, GEEN oordeel over de kwaliteit, betrouwbaarheid of reputatie van de shop.
Score-versie: v2-8pillar-2026-06
1. Wat we meten
Wij meten uitsluitend de technische AI- en agent-leesbaarheid van een publiek toegankelijke webshop: kunnen AI-shoppingagents (zoals GPT, Claude, Perplexity, Gemini) de shop vinden, interpreteren en er transacties mee voorbereiden? De score zegt niets over productkwaliteit, klantenservice, prijsbeleid of bedrijfsvoering.
2. Hoe we meten — 8 pijlers met vaste gewichten
De eindscore is een gewogen gemiddelde van 8 pijlers. De gewichten zijn hard-coded in de code en worden per scan opgeslagen samen met de score-versie. In totaal voeren we ~30 deterministische checks uit (geen LLM-oordeel voor deterministische pillars).
| Pillar | Weight | What |
|---|---|---|
| AI Visibility | 15% | Zichtbaarheid in AI-antwoorden.
|
| Agentic Commerce | 15% | Kan een AI-agent transacties initiëren?
|
| Schema.org | 13% | Structured data conform schema.org.
|
| Product Content | 13% | Kwaliteit van machine-leesbare productdata.
|
| Technical | 12% | Technische basisleesbaarheid.
|
| Trust Signals | 12% | Publiek zichtbare vertrouwenssignalen.
|
| Transaction Readiness | 10% | Kan een transactie technisch worden voltooid?
|
| Operational Maturity | 10% | Signalen van operationele volwassenheid.
|
Weeg-defaults: als een deterministische pijler niet gemeten kon worden, gebruiken we een conservatieve default van 40 (gedocumenteerd in PILLAR_DEFAULTS). Voor aiVisibility passen we NOOIT een default toe: als alle drie AI-modellen falen, wordt de pijler weggelaten uit teller én noemer — geen 'stille 50'.
3. Wat de score NIET is
Deze score is uitdrukkelijk geen:
- geen keurmerk voor betrouwbaarheid of veiligheid
- geen consumenten-recensie of ervaringsscore
- geen juridisch of AVG-conformiteits-oordeel
- geen aanbeveling of afraden om bij een shop te kopen
- geen garantie op leverbaarheid, kwaliteit of after-sales
4. Reproduceerbaar
Elke shop kan de eigen score narekenen: de 30+ deterministische checks halen publieke endpoints en HTML-signalen op (o.a. /.well-known/mcp.json, /llms.txt, robots.txt, JSON-LD Offer). Bij elke scan worden zowel de gewichten, defaults, aiMeasured-status als de gebruikte score-versie opgeslagen. Op verzoek leveren wij het volledige `pillarsUsed`/`defaultsUsed`-object van een specifieke scan aan.
5. Beperkingen en bekende onzekerheden
Deterministische checks vs. leverancier-specifieke AI Visibility
Zeven van de acht pijlers bestaan uit deterministische checks op publieke endpoints en HTML — die zijn leverancier-onafhankelijk en reproduceerbaar. Alleen de pijler AI Visibility (15%) is leverancier-specifiek: die meet zichtbaarheid bij de huidige generatie modellen (GPT, Claude, Perplexity, Gemini). Een hoge AI Visibility garandeert dus niet automatisch zichtbaarheid bij toekomstige of andere agents.
Rendering: agent-geschiktheid ≠ leesbaarheid zonder JavaScript
Wij halen elke shop zowel met een headless browser (JavaScript uitgevoerd) als met een kale HTML-fetch op. Het verschil tussen beide wordt als expliciete, benoemde bevinding gerapporteerd — een JS-afhankelijke shop krijgt dus geen verborgen straf, maar een zichtbare constatering dat niet-renderende crawlers minder zien.
Herkomst van de gewichten
De gewichten (15/15/13/13/12/12/10/10) zijn beargumenteerde inschattingen op basis van fout-impact: hoe hard breekt een agent-interactie als dit signaal ontbreekt? Ze zijn NIET empirisch gevalideerd tegen daadwerkelijke agent-conversieratio's. Dat is dezelfde aanpak als Google Lighthouse hanteert; wij benoemen het liever expliciet dan dat de score preciezer oogt dan hij is.
Bonuscategorieën tellen niet mee in de 100
Google Agent-Friendliness en Product Data Integrity zijn informatieve bevindingen/badges. Ze worden apart getoond, tellen niet op bovenop de 100 punten en zijn geen vermenigvuldigingsfactor. De eindscore is uitsluitend het gewogen gemiddelde van de acht pijlers.
Meetonzekerheid en modeldrift
LLM-oordelen zijn gevoelig voor promptvariatie en modelupdates. Wij draaien daarom wekelijks een test-hertest-controle: dezelfde shop wordt tweemaal op dezelfde dag gescand en het scoreverschil wordt gelogd en publiek getoond als meetonzekerheid (± punten). Scorewijzigingen binnen die marge moeten niet als echte sitewijziging worden gelezen.
Selectiebias in de discovery-engine
Onze discovery-engine vindt beter vindbare shops eerder, waardoor het Registry niet representatief is voor de volledige EU-e-commercemarkt. Dit is erkend en nog niet gemitigeerd. Op de roadmap voor Q4 2026 staat een gestratificeerde steekproef per land en sector.
Bezwaar of correctie
Ben je shop-eigenaar en klopt er iets niet? Vraag verwijdering of herbeoordeling aan via /data-aanvraag of privacy@langhoormarchal.com.