Is jouw bedrijfsdata goed genoeg voor AI?

Je data hoeft niet perfect. Ze moet wel goed genoeg zijn voor de specifieke toepassing. Zeven vragen om te beoordelen, drie categorieen van toepassingen en waarom je nooit wacht tot alles perfect is.

"Onze data is niet perfect. Kunnen we dan wel met AI starten?" Dat is de meest voorkomende vraag die we krijgen op een eerste kennismaking. Het geruststellende antwoord: je data hoeft niet perfect te zijn. Het minder eenvoudige antwoord: ze moet wel goed genoeg zijn voor de specifieke toepassing. De kwaliteitseisen voor een interne zoekassistent verschillen fundamenteel van de eisen om financiele transacties te beoordelen. De juiste vraag is dus niet of jouw data perfect is maar of de relevante data betrouwbaar genoeg is voor deze taak met een aanvaardbaar risico.

Is jouw bedrijfsdata goed genoeg voor AI?

Je data hoeft niet perfect te zijn voor AI, wel goed genoeg voor de specifieke toepassing. Een interne zoekassistent stelt fundamenteel andere kwaliteitseisen dan een systeem dat financiële transacties beoordeelt. De juiste vraag is dus niet of je data perfect is maar of de relevante data betrouwbaar genoeg is voor deze taak met een aanvaardbaar risico. Begin met één concrete toepassing en toets alleen de data die daarvoor nodig is, in plaats van eerst alles te willen opschonen.

Wat een AI-assistent voor kmo met die data kan, lees je op de dienstpagina.

Begin met een concrete toepassing

Een algemene beoordeling van je datakwaliteit loopt eindeloos en levert zelden een bruikbare conclusie op. Je start beter met een afgebakende use-case: technische documentatie doorzoeken, aankoopfacturen automatisch uitlezen, verkoopprognoses opstellen, klachten classificeren, offertes voorbereiden of productieafwijkingen detecteren. Pas als die toepassing scherp staat, bepaal je welke data je nodig hebt en welke kwaliteitseisen daarbij horen. Zo koppel je datavragen aan een concreet bedrijfsresultaat in plaats van aan een abstracte ambitie.

Zeven vragen om je data te beoordelen

Als je een toepassing hebt gekozen, helpen onderstaande zeven vragen je om snel in te schatten of jouw data die toepassing kan dragen. We stellen diezelfde vragen op elk eerste analysegesprek bij een klant.

Zijn de nodige gegevens beschikbaar?

In veel bedrijven staat de relevante info verspreid over mailboxen, gedeelde mappen, Excel-bestanden en verouderde software. Pas als die info beheerst toegankelijk is, kan een AI-toepassing er daadwerkelijk mee aan de slag. Beschikbaarheid gaat dus niet enkel over bestaan, ook over ontsluiten.

Is de informatie voldoende volledig?

Ontbrekende velden vormen niet altijd een probleem. Ze worden pas problematisch wanneer precies die velden nodig zijn voor de toepassing. Een betalingsprognose met ontbrekende vervaldata heeft een grote impact op het resultaat. Een samenvatting van interne procedures overleeft wat kleine gaten zonder al te veel schade.

Is de data correct?

Foutieve productcodes, dubbele klantenrecords en verouderde prijzen leiden onvermijdelijk tot foutieve resultaten. AI maakt slechte data niet plots betrouwbaar. Wat AI wel doet: fouten sneller en op grotere schaal verwerken. En dat is precies waarom je vooraf naar de brondata kijkt.

Gebruikt iedereen dezelfde begrippen?

Wat is precies een "actieve klant"? Wanneer noem je een order "te laat"? Welke kosten horen in welke categorie? Zodra afdelingen verschillende definities hanteren, produceert een AI-systeem tegenstrijdige conclusies uit dezelfde onderliggende data. Definities uitklaren is meestal goedkoper dan de gevolgen achteraf rechttrekken.

Is de data voldoende actueel?

Een AI-assistent die je handleidingen van drie jaar oud voorschotelt, geeft technisch correcte maar operationeel verouderde instructies. Leg daarom vast hoe nieuwe, gewijzigde en ingetrokken informatie in het systeem terechtkomt en hoe snel.

Is de herkomst controleerbaar?

Bij belangrijke beslissingen moet duidelijk zijn waar de info vandaan komt. Kan de gebruiker met een klik terug naar de bron of blijft de output een zwarte doos die je op geloof moet aannemen? Traceerbaarheid is geen luxe, ze bepaalt of mensen het systeem durven gebruiken.

Mag je die data voor dit doel gebruiken?

Niet alle info mag zomaar naar elk AI-platform. Controleer vertrouwelijkheid, persoonsgegevens, contractuele afspraken, intellectuele eigendom, toegangsrechten, bewaartermijnen en beveiligingsvereisten voor je een dataset in een externe dienst uploadt. Deze vraag hoort thuis in de eerste selectiegesprekken, niet in de laatste week voor livegang.

Niet elke toepassing vraagt dezelfde datakwaliteit

De kwaliteitseis hangt af van wat de toepassing doet met de output. Grofweg vallen AI-toepassingen in drie categorieen, elk met een eigen lat.

Ondersteunende toepassingen

Denk aan zoeken, samenvatten of een eerste versie van een document opstellen. Een medewerker leest het resultaat en corrigeert waar nodig. Enige onvolledigheid is aanvaardbaar zolang de bronnen zichtbaar blijven en de gebruiker snel kan verifieren.

Operationele toepassingen

Hier draaien we processen mee: classificatie van tickets, planning, boekingen. De data moet consistenter zijn en het systeem moet uitzonderingen duidelijk behandelen, want er zit minder menselijke controle tussen input en actie.

Beslissende toepassingen

Financiele, commerciele, personeels- of veiligheidsbeslissingen op basis van AI-output stellen hoge eisen: correctheid, uitlegbaarheid, controle, beveiliging en een sluitende audittrail. Hier begin je niet zonder grondige risicoanalyse en een duidelijk plan voor menselijke tussenkomst.

Hoe herken je onvoldoende datakwaliteit?

Er zijn duidelijke signalen dat je datahuishouding nog niet klaar is voor bepaalde toepassingen. Denk aan schaduwlijsten in Excel naast de officiele systemen, rapporten die verschillende KPI-cijfers geven voor dezelfde vraag, handmatige correcties op product- of klantdata, geen duidelijkheid over welke versie actueel is, dezelfde info in meerdere systemen naast elkaar, belangrijke velden die medewerkers vrij invullen, uitzonderingen die enkel in mailwissels leven en historiek die je moeilijk terugvindt. Deze signalen betekenen niet dat AI onmogelijk is. Ze betekenen wel dat het risico stijgt en dat je extra werk moet inplannen voor je aan een use-case begint.

Je hoeft niet eerst alle data op te schonen

De klassieke valkuil is wachten tot alles perfect staat. Dat moment komt zelden en intussen loop je achter op bedrijven die wel bewegen. Kies daarom een gerichte aanpak: bepaal welke data de use-case echt nodig heeft, meet de huidige kwaliteit van net die data, identificeer de fouten met de grootste impact, verbeter alleen wat nodig is voor deze toepassing, test met realistische voorbeelden en monitor de kwaliteit tijdens gebruik. Zo koppel je opschoning aan een concreet bedrijfsresultaat in plaats van aan een eindeloze schoonmaakactie die niemand ooit afsluit.

Test met moeilijke voorbeelden

Een AI-toepassing mag je niet alleen testen met nette, volledige en goed gekozen data. Gebruik ook onvolledige documenten, afwijkende formaten, dubbels, oude en nieuwe versies naast elkaar, zeldzame uitzonderingen, foutieve invoer en tegenstrijdige info uit verschillende bronnen. Pas dan zie je hoe de toepassing zich houdt in de dagelijkse werkelijkheid van je bedrijf, waar niets zo netjes is als in een demo.

Meet datakwaliteit in bedrijfsimpact

Technische percentages over volledigheid en correctheid zijn nuttig maar de impact op je onderneming telt meer. Een fout in een intern zoekresultaat heeft een andere gewichtsklasse dan een fout in een betalingsvoorstel of een productie-instructie. Beoordeel dus hoe vaak fouten optreden, hoe snel je ze ontdekt, hoeveel correctiewerk ze veroorzaken, welke financiele of operationele schade ze aanrichten en of een medewerker tijdig kan ingrijpen voor de fout zich doorzet in het proces.

Conclusie

Je data hoeft niet perfect te zijn maar wel geschikt voor de toepassing en het bijhorende risico. Kies een concrete use-case, bepaal welke data kritisch is voor het resultaat en test of die data beschikbaar, correct, actueel en controleerbaar is. Goede data is geen doel op zich. Ze is de voorwaarde voor een betrouwbaar bedrijfsresultaat met AI.

Wil je weten of jouw data klaar is voor de eerste AI-toepassing?

De SEMANU Analyse test een concrete AI-use-case tegen jouw daadwerkelijke data: beschikbaarheid, kwaliteit, definities en herkomst. Geen algemene score, wel een go/no-go per toepassing. Eenmalige investering vanaf 4400 euro.

Veelgestelde vragen

Moet mijn bedrijfsdata perfect zijn voor ik met AI kan starten?

Nee maar ze moet goed genoeg zijn voor de specifieke toepassing. Een zoekassistent tolereert onvolledige info als de bron zichtbaar blijft. Een AI die financiele transacties beoordeelt eist correctheid, uitlegbaarheid en een audittrail.

Hoe test je of AI werkt met slechte data?

Geef het systeem niet alleen nette voorbeelden. Test met onvolledige documenten, afwijkende formaten, dubbels, oude versies, zeldzame uitzonderingen en tegenstrijdige info. Pas dan zie je of de toepassing in de dagelijkse praktijk overeind blijft.

Welke datavragen moet je stellen voor een AI-use-case?

Is de data beschikbaar en toegankelijk, is ze voldoende volledig voor dit doel, is ze correct, gebruiken afdelingen consistente definities, is ze actueel, kan je de herkomst controleren en mag je ze contractueel en juridisch voor dit doel gebruiken.

Moet je eerst alle bedrijfsdata opschonen voor een AI-project?

Dat is de klassieke valkuil, want dat moment komt zelden. Kies een concrete use-case, meet de kwaliteit van net die data, verbeter alleen wat de meeste impact heeft en test tijdens gebruik. Zo koppel je opschoning aan een concreet bedrijfsresultaat.

TD

Geschreven door Tom de Vree, oprichter en Lead Business Analyst bij SEMANU. Begeleidt kmo's en mkb-bedrijven bij business analyse, softwareselectie en projectopvolging. LinkedIn · Over SEMANU

Tom de Vree · · 6 min leestijd