Bronherkomst
Waar relevant bewaren we bron-URL, bronnaam, bron-ID of meetmoment zodat resultaten terug te voeren zijn op de gebruikte bronset.
Wij behandelen bronkeuze, recorddefinitie, ontbrekende waarden, duplicaten, matches en uitzonderingen als onderdeel van de dataset. Zo wordt kwaliteit controleerbaar in plaats van een losse claim.
Bespreek kwaliteitsvereistenWaar relevant bewaren we bron-URL, bronnaam, bron-ID of meetmoment zodat resultaten terug te voeren zijn op de gebruikte bronset.
Vooraf wordt bepaald wat telt als product, bedrijf, locatie of ander record en wanneer varianten apart moeten blijven.
Niet gevonden is niet hetzelfde als nul, nee of niet-bestaand. Ontbrekende informatie blijft als zodanig herkenbaar.
Exacte duplicaten, waarschijnlijke dubbelen en unieke records worden volgens vooraf afgesproken regels behandeld.
Exacte koppelingen en waarschijnlijke matches worden niet als hetzelfde beschouwd wanneer de beschikbare identifiers onvoldoende zekerheid geven.
Bij periodieke runs worden onverwachte structuurwijzigingen en sterk afwijkende volumes gesignaleerd voordat ze stil in de dataset doorwerken.
Records die niet veilig automatisch kunnen worden geïnterpreteerd worden apart gehouden in plaats van geforceerd in het doelmodel geplaatst.
Wanneer dezelfde meting later wordt herhaald, gebruiken we waar mogelijk dezelfde populatie-, veld- en normalisatieregels.
Welke drempels gelden, hangt af van de opdracht. Een prijsfeed vraagt bijvoorbeeld andere controles dan een eenmalige leveranciersinventarisatie.
Voor start beoordelen we toegang, gebruikscontext, persoonsgegevens, bronbelasting en het doel waarvoor de dataset wordt gemaakt. We omzeilen geen beveiliging, verboden toegang of technische beschermingsmaatregelen.
ToegangAlleen bronnen en accounts waarvoor gebruik binnen de opdracht is toegestaan.
DataminimalisatieAlleen velden verzamelen die voor de zakelijke vraag relevant zijn.
BronbelastingPlanning, rate limiting, caching en retries afstemmen op een verantwoorde uitvoering.
BeveiligingWachtwoorden, tokens en vertrouwelijke datasets niet via openbare formulieren uitwisselen.
BewaringTestdata en tussenbestanden niet langer bewaren dan nodig of afgesproken.
GebruikDe opdrachtgever blijft verantwoordelijk voor het rechtmatige gebruik van de opgeleverde dataset binnen de eigen context.
We doen geen algemene volledigheidsclaim over externe bronnen. De kwaliteit wordt beoordeeld tegen de afgesproken bronset, populatie, velden en meetmomenten. Onbekende informatie wordt niet verzonnen om een bestand completer te laten lijken.
Bekijk de werkwijzeBeschrijf de doelgroep, markt, producten of bron die u wilt onderzoeken. Wij vertalen dat naar een afgebakende dataset met duidelijke velden, bronnen en oplevering.
Bespreek uw dataset