Eerst definiëren wat een bruikbare dataset is. Daarna bouwen we de keten ernaartoe.
De specificatie is leidend: entiteit, velden, filters, bronnen, kwaliteitsregels, output en aflevermoment.
Iedere fase maakt de levering concreter en beter controleerbaar.
We voorkomen dat techniek wordt gebouwd voordat duidelijk is welke data als correct resultaat geldt.
- 01
Datavraag
Doel, doelgroep, entiteit, velden, filters, volume-indicatie en gewenst gebruik worden vastgelegd.
- 02
Bronanalyse
Beschikbare websites, API’s, bestanden en systemen worden beoordeeld op toegang, structuur en bruikbaarheid.
- 03
Dataspecificatie
Velddefinities, normalisatie, koppelsleutels, bronprioriteit, controles en output worden beschreven.
- 04
Proeflevering
Een beperkte dataset toetst of selectie, velden en kwaliteitsregels in de praktijk aansluiten.
- 05
Productie
De volledige dataset wordt verzameld, verrijkt, gecombineerd en gevalideerd.
- 06
Aflevering
Data wordt via de afgesproken route geleverd; bij periodieke opdrachten worden planning, logging en beheer geactiveerd.
Automatisch waar de regel hard genoeg is. Review waar onzekerheid betekenis heeft.
Een foutieve match kan schadelijker zijn dan een lege waarde. Daarom maken we onderscheid tussen zekere matches, afgeleide waarden en records die menselijke beoordeling nodig hebben.
Een levering wordt beoordeeld tegen vooraf afgesproken criteria.
Denk aan verplichte kolommen, formaat, maximum foutpercentage voor technische validaties, verwachte bronset, duplicaatregels en afgesproken uitzonderingsoutput. Bij een datafeed hoort daar ook technische afleverbevestiging bij.