Toonaangevende tools voor gegevensopschoning

Een uitgebreide gids die inzicht biedt in de verschillende leveranciers en softwaretools die beschikbaar zijn voor alle soorten normalisatie en opschoning van B2B-gegevens.

Handboek voor gegevensopschoning

Zoals te zien op...

Inhoudsopgave

Een vergelijking van de beste software en leveranciers voor gegevensopschoning

Om een softwaresysteem of organisatorisch proces soepel te laten functioneren, is de kwaliteit van de onderliggende gegevens even belangrijk, zo niet belangrijker, dan de zeer technische systemen en softwareplatforms die voor de continuïteit en nauwkeurigheid van de bedrijfsvoering afhankelijk zijn van die gegevens.

Helaas hebben de beschikbaarheid en de bereidheid van organisaties om de gegevenskwaliteit te handhaven en te verbeteren, het tempo van andere technologieën niet kunnen bijhouden.

Sinds 2021, direct na de eerste publieke aankondiging van het conversatie-AI-platform ChatGPT en de daaropvolgende onthulling van agentische systemen die zelfstandig een ontelbaar aantal taken kunnen uitvoeren, staat het debat over gegevenskwaliteit weer volop in de belangstelling.

Dit geldt des te meer nu bedrijven tot het besef zijn gekomen dat zelfs de beste technologisch geavanceerde systemen nutteloos zijn of onnauwkeurige resultaten opleveren wanneer de onderliggende gegevens onvolledig, gedupliceerd of onbetrouwbaar zijn en niet gesynchroniseerd zijn met andere gegevensbeheersystemen.

De onderstaande grafiek laat een stijging zien in het aantal zoekopdrachten van gebruikers die op zoek zijn naar diensten en tools voor gegevensopschoning om de kwaliteitsnormen voor gegevens continu te waarborgen.

Een afbeelding die de veranderingen laat zien in de grafiek van zoekresultaten voor gegevensopschoning en aanverwante zoektermen

Om inkopers, inkoopprofessionals, datamanagement- en GTM-teams van de juiste informatie te voorzien, worden in dit artikel enkele toonaangevende platforms voor gegevensopschoning op een rijtje gezet, grofweg ingedeeld in de volgende categorieën.

  1. Software voor het opschonen van CRM-gegevens
  2. Software voor het opschonen van ERP-gegevens
  3. Opschoning van personeels- en HR-gegevens
  4. Eenmalige gegevensopschoning [Op maat]

#1, #2 en #3 uit het bovenstaande zijn veelvoorkomende en terugkerende vereisten, vooral wanneer er geen degelijk kader voor gegevensbeheer is.

#4 betreft echter unieke, eenmalige vereisten voor gegevensopschoning die op maat zijn en doorgaans niet terugkeren, aangezien ze per project worden uitgevoerd.

Daarnaast zal deze lijst een breed scala aan platforms voor tools voor gegevensopschoning bevatten, waaronder ETL-tools, speciaal voor dit doel ontwikkelde opschoningssoftware, open-sourceplatforms, software voor gegevensvoorbereiding, enzovoort.

Aangezien ‘datacleaning’ een breed begrip is, worden de in dit artikel beschreven tools bovendien beoordeeld op hun mogelijkheden op het gebied van:

  1. Gegevensrecords vanuit een ongestructureerd formaat normaliseren naar een gestructureerd formaat
  2. Validatie van gegevens
  3. Aanvulling van gegevensrecords
  4. Ontdubbeling
  5. Integratie met gerelateerde datasets en technologiesystemen

Tools voor het opschonen van CRM-gegevens

De meeste bedrijven met een omzet van meer dan een miljoen $ maken doorgaans gebruik van een CRM-systeem. Het doel van het CRM-systeem is om de verschillende fasen in het traject van prospects, leads, verkoopkansen en klanten gedurende de conversiecyclus vast te leggen en de verkoop-, marketing- en operationele teams te voorzien van de juiste gegevens.

Sommige CRM-systemen registreren zelfs partnergegevens en verbanden tussen partners, leads en doelaccounts.

Deze gegevens verliezen echter in de loop van de tijd aan kwaliteit, aangezien dubbele gegevens, ontbrekende informatie en onjuiste koppelingen tussen gegevens veel voorkomen bij go-to-market- en bedrijfsteams, en de beste praktijken op het gebied van gegevensbeheer niet altijd worden nageleefd.

Openprise

Openprise profileert zich als een platform voor data-orkestratie en -automatisering dat is ontworpen om bedrijven te helpen bij het beheren, opschonen en samenvoegen van hun gegevens in marketing-, verkoop- en operationele systemen.

Het unieke verkoopargument van de software is de naadloze integratie met diverse GTM-systemen, waaronder CRM, ERP, klantgegevensplatforms (CDP’s), advertentieplatforms en andere tools van derden voor klantenbenadering en het verzamelen van informatie.

De onderstaande afbeelding laat zien hoe OpenPrise de afdelingen Revenue Operations, Performance Marketing en de bedrijfsteams ondersteunt met schone, nauwkeurige en betrouwbare gegevens.

In grote lijnen zijn dit enkele van hun belangrijkste capaciteiten.

  1. Het verwijderen van dubbele vermeldingen op contact- en accountniveau – door gebruik te maken van e-mailadressen, websitedomeinen, semantische patronen en menselijke controle
  2. Validatie van e-mailadressen en telefoonnummers om ongeldige waarden te verwijderen
  3. Adressen en postcodes normaliseren,
  4. Locatiegegevens afleiden uit telefoonnummers
  5. Gegevens over steden of staten afleiden uit postcodes, of omgekeerd
  6. Waarden en opmaakstandaarden – bijvoorbeeld: namen in hoofdletters, e-mailadressen in kleine letters, enzovoort
  7. Het aanvullen van ontbrekende waarden is ook mogelijk door gebruik te maken van contactinformatieoplossingen van derden

Naast het opschonen van gegevens biedt Openprise ook een aantal oplossingen om leads toe te wijzen door ze te scoren en door te sturen naar de juiste verantwoordelijke.

Recensies:

Datablist

DataBlist profileert zich als een praktische tool voor gegevenskwaliteit en lijstvoorbereiding, bedoeld voor teams die regelmatig werken met datasets in spreadsheets, zoals contactlijsten, klantgegevens, productcatalogi of leads die voortkomen uit evenementen.

Het platform is in de eerste plaats bedoeld om zakelijke gebruikers te helpen bij het opschonen, structureren en standaardiseren van grote hoeveelheden gegevens, zonder dat daarvoor IT-ondersteuning, technische scripts of ingewikkelde programmeerwerkzaamheden nodig zijn.

De kracht ervan ligt in het bieden van een vertrouwde werkruimte in rastervorm, waar gebruikers snel records kunnen controleren, correcties kunnen aanbrengen en waarden kunnen afstemmen voordat de gegevens in CRM-, marketing- of operationele systemen worden geladen.

De onderstaande afbeelding laat zien hoe Datablist duplicaten en andere afwijkingen in datasets opspoort

Een afbeelding die de geautomatiseerde detectie van gegevensafwijkingen op het DataBlist-platform laat zien

In grote lijnen biedt DataBlist een reeks praktische functies waarmee teams lijsten kunnen opschonen en voorbereiden voordat ze deze in hun operationele systemen importeren.

  1. Detecteert dubbele vermeldingen in de velden voor namen, e-mailadressen, telefoonnummers en bedrijfsgegevens, waardoor gebruikers de records kunnen controleren en op een overzichtelijke manier kunnen samenvoegen.
  2. Signaleert ongeldige e-mailadressen, onjuiste telefoonformaten en ontbrekende verplichte gegevens om het aantal uploadfouten in CRM- en marketingsystemen te verminderen.
  3. Brengt hoofdlettergebruik, telefoon- en e-mailformaten en andere inconsistente velden in geïmporteerde lijsten op één lijn.
  4. Ondersteunt verrijking op basis van opzoekacties en eenvoudige regels om ontbrekende statussen, classificaties of gerelateerde velden in te vullen.
  5. Splitst lange adressen op, corrigeert onjuiste combinaties van plaatsnamen en postcodes, en koppelt postcodes aan staten.
  6. Helpt bij het in kaart brengen en op elkaar afstemmen van kolommen bij het samenvoegen van lijsten afkomstig van partners, evenementen of oudere systemen.
  7. Maakt bulkbewerkingen en voorwaardelijke updates mogelijk, met een voorbeeldweergave om onbedoeld overschrijven te voorkomen.
  8. Wordt gebruikt als tussenlaag om ervoor te zorgen dat gegevens in een schone en consistente vorm worden ingevoerd in Salesforce, HubSpot, outreach-tools, inkoopsystemen en rapportageplatforms.

Over het geheel genomen biedt het platform de operationele en RevOps-teams een praktische omgeving om hun gegevens te controleren, te corrigeren en te structureren, zodat deze soepel kunnen worden overgedragen naar de systemen die ervan afhankelijk zijn.

Recensies:

Opschoning van ERP-stamgegevens

Een ERP-systeem wordt doorgaans vooral door grote ondernemingen gebruikt en komt veel minder vaak voor dan een CRM-systeem.

Doorgaans wordt een ERP-systeem niet naast een CRM-systeem gebruikt, aangezien het al grotendeels de beoogde functies van een CRM-systeem vervult. Hoewel dit niet per se het geval hoeft te zijn.

Een ERP-systeem heeft bovendien een veel bredere reikwijdte en is niet eens te vergelijken met een CRM-systeem.

ERP- en EAM-systemen beheren alle functies, waaronder productieplanning, personeelszaken, financieel beheer en boekhouding, naast activiteiten die specifiek betrekking hebben op de marktintroductie.

Deze systemen worden doorgaans gebruikt bij grote ondernemingen, waar het totale aantal records over het algemeen vrij groot en verspreid is, waardoor het opschonen van gegevens een stuk lastiger is.

De soorten gegevensopschoning veranderen van tijd tot tijd.

  1. Het opschonen van „materiële“ gegevens
  2. Opschoning van de stamgegevens van „klanten“
  3. Opschoning van gegevens over „leveranciers“
  4. Opschoning van gegevens over „Diensten“
  5. Opschoning van gegevens over „vaste activa”

Verdantis MDM Suite

Verdantis is gespecialiseerd in bedrijfssoftwareoplossingen, met name voor organisaties met een groot aantal bedrijfsmiddelen. De MDM-suite van Verdantis is speciaal ontwikkelde software voor het beheer van de kwaliteit van stamgegevens binnen datadomeinen die specifiek zijn voor productiegegevens.

De software is getraind op basis van gegevensrecords die specifiek zijn voor de onderstaande sectoren en maakt gebruik van agent-gebaseerde AI om tekortkomingen in de gegevenskwaliteit in alle stamgegevensdomeinen te verhelpen.

De twee modules die beschikbaar zijn in de Verdantis MDM-suite zijn Harmonize en Integrity;

Harmoniseren: Deze module is gericht op het normaliseren, opschonen en verrijken van verouderde stamgegevensrecords door deze niet alleen uit de ERP- of EAM-systemen te verzamelen, maar ook uit diverse ongestructureerde bronnen, zoals leveranciersfacturen, stuklijsten van bedrijfsmiddelen en externe informatiebronnen zoals D&B, ZoomInfo enz.

Integriteit: Zoals de naam al aangeeft, is Integrity een module die zorgt voor het beheer van stamgegevens en die dezelfde gegevensdomeinen bestrijkt als hierboven vermeld. Deze module kan worden geïntegreerd met ERP-systemen met één of meerdere omgevingen, stamgegevensstacks of EAM-systemen om een proces op te zetten en beheert elke invoer van stamgegevensrechtstreeks bij de bron zelf.

De module Integriteit is bedoeld om het volgende te waarborgen:

  1. De tijd die nodig is voor het aanmaken van een stamgegevensrecord is drastisch verkort
  2. De nauwkeurigheid en volledigheid (integriteit) van de hoofddataset worden gewaarborgd doordat de records doorlopend worden aangemaakt

Het idee achter stamgegevens, ERP-systemen en operationele uitmuntendheid in het algemeen is om de uitvoeringstijd van taken te verkorten; het invoeren en beheren van gegevens zijn taken die veel middelen vergen, met name op het gebied van personeel.

Om dit te beperken, synchroniseert Integrity met andere bedrijfsmodules en controleert het de aanmaak van records in realtime – waarbij mogelijke dubbele records en ontbrekende verplichte gegevens worden gemarkeerd.

Het gaat zelfs nog een stap verder en zet AI-agenten in om ontbrekende informatie automatisch aan te vullen op basis van geverifieerde bronnen van derden, zoals leverancierscatalogi, databases, bedrijfsinformatiesoftware en zelfs een bijgehouden lijst met websites.

In de onderstaande video wordt getoond hoe Integrity binnen de MDM-suite van Verdantis werkt om het aanmaken van records te beheren en de bedrijfsstamgegevens doorlopend te beheren.

Recensies:

Ataccama ONE

Ataccama is een geïntegreerd platform voor gegevensbeheer, ontwikkeld voor ondernemingen die masterdatabeheer (MDM), gegevenskwaliteit, governance en automatisering onder één dak willen samenbrengen.

Het kernproduct, Ataccama ONE, is een geïntegreerde oplossing die niet alleen MDM ondersteunt, maar ook dataprofilering, observability, lineage, referentiegegevens en agentgebaseerde, AI-gestuurde automatisering. 

In de onderstaande video wordt uitgelegd hoe Ataccama werkt en wat de belangrijkste functies zijn:

Ataccama ONE is opgebouwd rond modulaire functies, waarvan de twee belangrijkste zijn: 

– Gegevenskwaliteit en observeerbaarheid: De module automatiseert het opstellen van gegevensprofielen, AI-gestuurde kwaliteitscontroles en realtime monitoring. De module spoort afwijkingen op, doet suggesties voor oplossingen en ondersteunt het opschonen en verrijken van gegevens in alle belangrijke gegevensdomeinen.

– Beheer van stamgegevens: De MDM-module zorgt voor gestandaardiseerde, betrouwbare stamgegevens die domeinoverschrijdend zijn. De module kan worden geïntegreerd met ERP-systemen en bedrijfsinformatiesystemen om het aanmaken, aanvullen, goedkeuren en publiceren van gegevens te beheren, waarbij gebruik wordt gemaakt van uniforme matching en ontdubbeling om een consistent en betrouwbaar ‘golden record’ te waarborgen.

Het doel van deze module is vrij duidelijk:

  • De tijd en het handmatige werk dat gepaard gaat met het aanmaken of bijwerken van stamgegevens verminderen

  • Zorg ervoor dat de gegevens nauwkeurig, volledig en naar behoren gevalideerd zijn

  • Zorg voor duidelijk inzicht in wie wat en wanneer heeft gewijzigd, door middel van traceerbaarheid en het bijhouden van goedkeuringen

Om dit mogelijk te maken, controleert Ataccama ONE elk nieuw of binnenkomend record in realtime. Als er iets ontbreekt, dubbel is of onjuist is opgemaakt, signaleert het systeem dit voordat de gegevens in de downstream-systemen worden opgeslagen. 

Ataccama werkt samen met bedrijven in de BFSI-sector, de telecomsector, de farmaceutische sector en de overheidssector, met opvallende klanten zoals Aviva, UniCredit, T-Mobile, Roche en Philip Morris International.

Recensies:

SAP MDG

SAP is ongetwijfeld de pionier en de voorloper op het gebied van ERP-stamgegevensbeheer. MDG, de afkorting van ‘master data governance’, werd in 2010 door SAP geïntroduceerd en biedt een oplossing voor de behoeften van ondernemingen op het gebied van het waarborgen van de kwaliteit van stamgegevens.

Een van de belangrijkste troeven van SAP MDG is de ondersteuning door het ecosysteem bij het extraheren en samenvoegen van gegevens uit SAP-specifieke systemen. Gebruikers kunnen gegevens rechtstreeks extraheren of MDG integreren met hun SAP-ERP-systemen, EAM, SAP PM en een hele reeks andere SAP-native softwareoplossingen.

Dat gezegd hebbende, zijn er enkele beperkingen aan SAP MDG die het voor bedrijven moeilijk maken om dit systeem in te zetten voor hun stamgegevensbehoeften.

  1. Beperkte AI- en automatiseringsfuncties

Met de modus „Central Governance“ in SAP S/4HANA (Feature Pack Stack 2) en de private-cloud-edities ondersteunt MDG prompts in natuurlijke taal voor het aanbrengen van wijzigingen in velden en kan het automatisch overzichten van wijzigingen genereren.

SAP heeft Joule geïntroduceerd, een generatieve AI-assistent/copiloot die speciaal is ontwikkeld voor SAP-cloudtoepassingen. Het systeem is gebaseerd op bedrijfsgegevens, ondersteunt natuurlijke taal en beschikt over autonome ‘agent’-mogelijkheden.

Ondanks deze aankondigingen lijken de praktische toepassingen van AI-specifieke functies in SAP MDG op het moment van schrijven van dit bericht nog beperkt.

Hoewel er veel aandacht is voor AI-agenten, is de agentische autonomie (d.w.z. volledig autonoom besluitvormende agenten in MDG) in MDG nog steeds enigszins beperkt. Zo is de Lijst met functies van de G2 laat zien dat er voor „Agentische AI – Autonome taakuitvoering / Meerstapsplanning / Adaptief leren“ „onvoldoende gegevens“ beschikbaar zijn.

  1. Integraties met niet-SAP-systemen kunnen complex en duur worden

Afhankelijk van de aard van de bedrijfsactiviteiten en de sector zijn de vereisten voor stamgegevens bij elke onderneming sterk afhankelijk van het betreffende „gegevensdomein“.

Een onderneming met een kapitaalintensieve bedrijfsvoering heeft bijvoorbeeld geavanceerde mogelijkheden voor gegevensopschoning nodig op het gebied van materiaal-, vaste activa- (apparatuur) en leveranciersgegevens.

Evenzo kan een onderneming die zich specifiek bezighoudt met „SaaS“ of „Services“ behoefte hebben aan geavanceerde mogelijkheden voor gegevensopschoning binnen de gegevensdomeinen „services“ en „klanten“.

Om deze mogelijkheden te ontwikkelen en gegevens op te halen, is een bidirectionele synchronisatie is noodzakelijk en dit kan bij niet-SAP-systemen behoorlijk complex en duur zijn.

  1. Het ontwikkelen van een aangepast domein is complex

SAP MDG biedt uitgebreide standaardondersteuning voor belangrijke stamgegevensdomeinen zoals Zakelijke partners, Materiaal en Financiën.

Wanneer organisaties echter extra of branchespecifieke gegevensdomeinen moeten beheren — bijvoorbeeld activa, projecten, locaties of apparatuur — krijgen ze vaak te maken met aanzienlijke implementatieproblemen.

  1. Beperkte ingebouwde functies voor gegevenskwaliteitsbeheer

Hoewel SAP MDG regels voor gegevensvalidatie en -afleiding biedt, ontbreken geavanceerde algoritmen voor gegevensopschoning of -afstemming.

Bedrijven hebben mogelijk SAP Data Services (BODS), SAP Information Steward of tools van derden (zoals Informatica of Trillium) nodig voor een grondige gegevensopschoning, -verrijking en het opsporen van dubbele gegevens.

Voorbeeld: Voor het opsporen van „dubbele klanten“ met kleine variaties in de naam kan een externe tool voor gegevenskwaliteitscontrole nodig zijn.

Categorie

Sterke punten

Beperkingen

Integratie

Uitstekend geschikt voor SAP-omgevingen

Minder geschikt voor niet-SAP-systemen

Gegevensbeheer

Robuuste workflows en rollen

Kan tot knelpunten in het proces leiden

Gegevenskwaliteit

Basisvalidaties

Beschikt niet over geavanceerde reinigingsfuncties of AI-functies

Maatwerk

Zeer flexibel

Ingewikkeld en tijdrovend

Kosten en inspanning

Betrouwbaarheid op bedrijfsniveau

Hoge TCO en installatietijd

Gebruikerservaring

Verbeterd met Fiori

Nog steeds te ingewikkeld voor gewone gebruikers

Recensies:

ETL-/datatransformatietools

ETL-software is uitermate geschikt voor het opschonen van ongestructureerde gegevens, met name bij eenmalige taken waarvoor geen op training gebaseerde frameworks of woordenboekmodificatoren beschikbaar zijn.

ETL staat simpelweg voor Extract, Transform & Load. Eenvoudig gezegd haalt de software gegevens op uit verschillende externe bronnen, hetzij via API-verbindingen, hetzij via kant-en-klare integraties.

De volgende stap is de transformatie. Op dit moment zijn het tabelschema en de formaten definitief vastgesteld, zodat de gegevens geschikt zijn voor verdere analyse.

Dit is ook de fase waarin de gegevens worden opgeschoond, verrijkt, gevalideerd en ontdaan van dubbele records.

Vrijwel alle populaire ETL-softwareprogramma’s beschikken over mogelijkheden voor gegevensopschoning, met een gebruiksvriendelijke grafische gebruikersinterface waarmee de gegevens eenvoudig kunnen worden opgeschoond zonder dat daarvoor veel technische kennis nodig is.

De opschoning gebeurt aan de hand van verschillende methoden en wordt meestal uitgevoerd door data-engineers, analisten of stewards.

Hieronder worden enkele gebruikte technieken nader toegelicht.

1. Formules van het type SQL gebruiken binnen de GUI – 

Formules zoals

SELECT DISTINCT customer_id, email, name FROM customers; kan worden gebruikt om exacte duplicaten te verwijderen. GROUP BY is een andere SQL-uitdrukking die wordt gebruikt om overeenkomsten in een dataset op te sporen.

Afhankelijk van de mate van complexiteit van de gegevens kunnen ook geavanceerde Fuzzy Logic-algoritmen worden ingezet om bijna-duplicaten op te sporen

2. Regels voor gegevensvalidatie – Datumnotaties, numerieke waarden, regels voor keuzelijsten enzovoort zijn zo ingesteld dat inconsistenties worden voorkomen

3. Omgaan met ontbrekende waarden – Nulwaarden of ontbrekende waarden worden eveneens gemarkeerd en vervolgens aangevuld of afgewezen.

4. Sommige ETL-tools beschikken ook over ingebouwde functies om externe gegevensbronnen te koppelen en zo ontbrekende velden in te vullen

5. Standaardisatie – Het omzetten van inconsistente notaties naar één standaardnotatie. Bijvoorbeeld: usd of USD naar $ of

6. Controle op uitschieters –  Het opstellen van regels om waarden te detecteren die ver buiten de verwachte bereiken vallen. Hierbij speelt ook domeinspecifieke kennis een rol bij het vaststellen van minimum- en maximumwaarden; bovendien kunnen er drempelwaarden voor de tekenlengte worden ingesteld voor verschillende eigenschappen, waarna uitschieters kunnen worden beoordeeld en afgewezen, aangevuld of toegevoegd aan een workflow.

Inlezen – Ten slotte kunnen de opgeschoonde en bewerkte gegevens worden ingelezen in het doelsysteem, zoals een datawarehouse of een datameer, waar ze kunnen worden geanalyseerd of gebruikt voor rapportages.

Hier vind je een aantal transformatietools voor het opschonen van gegevens

AWS Glue

AWS Glue is een volledig beheerde ETL-service die wordt aangeboden door Amazon Web Services.

We hebben uitgebreid besproken hoe ETL-tools het volledige proces kunnen automatiseren waarbij gegevens uit verschillende bronnen worden samengevoegd en vervolgens in een data lake worden ondergebracht.

AWS Glue werkt op een vergelijkbare manier: het is ontworpen om gebruikers te helpen bij het voorbereiden en verplaatsen van gegevens tussen verschillende gegevensopslagplaatsen, zodat deze gegevens kunnen worden gebruikt voor analyses, machine learning en applicatieontwikkeling, zonder dat ze servers of complexe infrastructuur hoeven te beheren.

Naast de aspecten die hieronder nader worden toegelicht, is AWS Glue een ideale keuze voor gebruikers die op zoek zijn naar native integraties binnen het ecosysteem van Amazon [S3, RDS, Redshift, Athena, Lake Formation, CloudWatch].

Hieronder vind je een video waarin wordt getoond hoe Zoho DataPrep kan worden gebruikt voor het opschonen en transformeren van gegevens:

Waarin onderscheidt AWS Glue zich?

– Gegevensprofilering: De crawlers van AWS Glue scannen zelfstandig gegevensbronnen (bijv. S3, RDS, Redshift) enz. om gegevensmodellen, tabelschema’s en gegevenstypen af te leiden en om te gaan met variaties in bestandsformaten (CSV, Parquet). In andere verouderde ETL-tools gebeurt dit vaak handmatig.

Voordeel: Snelle integratie van ongestructureerde of semi-gestructureerde gegevens met een minimum aan handmatige schemadefinitie.

– Ingebouwde functies voor gegevenskwaliteit en profilering (Glue Data Quality): Glue bevat nu functies voor gegevenskwaliteit waarmee u regels en beperkingen kunt definiëren (bijvoorbeeld „geen null-waarden in de primaire sleutel“, „waarde tussen 0 en 100“) en datasets automatisch kunt valideren.

Voordeel: Continue controle van de gegevenskwaliteit, rechtstreeks geïntegreerd in het opschoningsproces.

– Flexibiliteit in de programmeertaal (Python + Spark): Gebruikers kunnen nu rechtstreeks in Glue Studio aangepaste opschoningslogica schrijven met behulp van PySpark- of Python-scripts. Glue ondersteunt ook aangepaste transformaties en op machine learning gebaseerde opschoning, zoals het matchen van entiteiten of het opsporen van uitschieters, met behulp van AWS Glue ML Transforms.

Voordeel: Ontwikkelaars beschikken zowel over automatisering als over volledige controle bij complexe opschoningsscenario’s.

– Voordelen op het gebied van kosten en onderhoud: Omdat Glue serverloos is, betalen gebruikers en organisaties alleen voor de rekentijd die door taken wordt gebruikt, waardoor het niet echt nodig is om ETL-servers of een infrastructuur voor gegevensopschoning te onderhouden.

Voordeel: Lagere totale eigendomskosten (Cost of Ownership) voor doorlopende of grootschalige gegevensopschoningsactiviteiten.

Enkele aandachtspunten bij AWS Glue (met tijdelijke oplossingen)

Ondanks de vele voordelen en pluspunten van AWS Glue is het belangrijk om te beseffen dat het geen wondermiddel is; uit feedback van gebruikers blijkt namelijk dat de prestaties soms onder de maat zijn

Opstartvertraging van taken

Het kan 2 tot 5 minuten duren voordat Glue-taken opstarten, omdat AWS eerst een beheerde Spark-omgeving moet opstarten (vooral bij de eerste taak van de dag). Hierdoor is Glue mogelijk niet geschikt voor ETL-taken met een lage latentie of in realtime.

Als alternatief kunnen gebruikers Glue Streaming-taken gebruiken voor pijplijnen die bijna in realtime werken.

Een ander alternatief kan zijn om gebruik te maken van Persistent Compute (bijvoorbeeld AWS EMR of Glue for Ray) in gevallen waarin de opstarttijd van cruciaal belang is

Schema-afwijking en complexe gegevens

Hoewel DynamicFrames een uitkomst bieden, interpreteert Glue soms gegevenstypen verkeerd (bijvoorbeeld gehele getallen als tekenreeksen) of slaagt het er niet in om geneste schemawijzigingen correct af te leiden. Dit betekent dat daaropvolgende taken kunnen mislukken of inconsistente resultaten kunnen opleveren.

Als risicobeperkende maatregel kan men

  • Controleer de schema-afleiding handmatig in de Glue Data Catalog.
  • Gebruik aangepaste classificatoren voor niet-standaard bestandsformaten.
  • Implementeer schemaversiebeheer en regels voor gegevensvalidatie.

Foutopsporing en observeerbaarheid

Het opsporen van fouten in Spark-taken in Glue kan lastig zijn, aangezien de logbestanden in CloudWatch worden opgeslagen, maar deze kunnen erg uitgebreid en moeilijk te doorgronden zijn. Dit leidt tot een trager probleemoplossingsproces bij problemen met de transformatielogica of de gegevenskwaliteit.

Als alternatief kunnen gebruikers:

– Gebruik Glue Studio voor het visueel samenstellen van taken en het bekijken van een voorbeeld van de gegevens

– Schakel taakbladwijzers en statistieken in voor incrementele foutopsporing

– Gebruik ontwikkelings-endpoints voor iteratief testen (hoewel deze wel duur kunnen zijn).

Recensies:

Matillion

In tegenstelling tot veel traditionele cloud-ETL-tools die zich sterk richten op het coördineren van pijplijnen of op ontwikkelaars gerichte workflows, positioneert Matillion zich als een „Data Productivity Cloud” die erop gericht is bedrijfsteams te helpen bij het opzetten, automatiseren en beheren van pijplijnen op grote schaal, zonder dat daarvoor diepgaande programmeerkennis nodig is.

De aantrekkingskracht ervan is grotendeels te danken aan de naadloze integratie met moderne cloud-datawarehouses zoals Snowflake, Databricks, Redshift en BigQuery, waar het native pushdown-verwerking biedt om de prestaties te verbeteren.

Matillion is ontwikkeld voor teams die regelmatig grote datasets verplaatsen, voorbereiden en transformeren en behoefte hebben aan een tool die visuele workflows combineert met uitbreidbaarheid.

Hoewel het zich profileert als een low-code-oplossing, biedt het toch voldoende flexibiliteit voor engineeringteams om pijplijnen waar nodig aan te passen met behulp van Python of SQL.

Matillion biedt directe integraties met meer dan 150 bronnen, waaronder databases, SaaS-tools, cloudopslag en berichtenstromen.

In de onderstaande video wordt gedemonstreerd hoe het visuele canvas van Matillion kan worden gebruikt om gegevens uit meerdere cloudtoepassingen naar Snowflake te halen en transformatiestappen toe te passen via slepen en neerzetten.

Zodra de gegevens zijn ingelezen, helpen de transformatiecomponenten van Matillion gebruikers bij het uitvoeren van toewijzingen, ontdubbeling, validatieregels en verrijkingsstappen. De meeste van deze componenten zijn kant-en-klaar, waardoor het eenvoudiger wordt om een schaalbare workflow samen te stellen zonder dat elke stap handmatig hoeft te worden geprogrammeerd.

De tool biedt ook ondersteuning voor het coördineren van taken, planning, CI/CD en monitoringdashboards voor teams die meerdere pijplijnen tegelijkertijd beheren.

Enkele valkuilen

Hoewel Matillion een krachtig hulpmiddel is voor teams die met cloudgegevens werken, zijn er enkele beperkingen waar gebruikers vaak op wijzen:

  • Veel systeembronnen vereist bij grote transformaties: Aangezien Matillion in hoge mate afhankelijk is van pushdown naar cloudwarehouses, kunnen gebrekkige SQL-logica of niet-geoptimaliseerde transformaties leiden tot hoge rekenkosten voor het warehouse. Sommige gebruikers merken op dat het optimaliseren van de prestaties een terugkerende taak wordt.

  • Een steilere leercurve dan aangekondigd: Hoewel het als ‘low-code’ op de markt wordt gebracht, geven veel gebruikers aan dat een gedegen kennis van SQL en praktische ervaring nodig zijn om inzicht te krijgen in het gedrag van het cloudwarehouse, de afhankelijkheden tussen taken en de transformatiecomponenten.

  • Zorgen over de prijsstelling: Op beoordelingssites zoals G2 wordt vermeld dat de op verbruik gebaseerde prijsstelling van Matillion snel kan oplopen voor organisaties die hun pijplijn regelmatig vernieuwen.

Over het algemeen is Matillion het meest geschikt voor middelgrote tot grote ondernemingen met bestaande cloud-datawarehouses en teams die zowel visuele workflows als SQL-gestuurde optimalisaties kunnen beheren.

Recensies:

Zoho DataPrep

In tegenstelling tot andere ETL-tools voor gegevensnormalisatie in deze lijst, wordt Zoho DataPrep op grote schaal aangeprezen als een „No-Code“-oplossing voor het koppelen en samenvoegen van gegevens uit verschillende bronnen en het opbouwen van ETL-pijplijnen sneller door GenAI-modellen in te zetten.

Zoho is, voor wie het nog niet weet, een Indiase softwaregigant met diverse B2B-softwareproducten op het gebied van CRM, boekhouding, personeelsbeheer en voorraadbeheer. Je mag dus aannemen dat ze het een en ander weten over het opschonen van gegevens, met name als het gaat om klant- en voorraadgegevens.

Zoho DataPrep biedt kant-en-klare integraties met meer dan 70 verschillende bronnen om de ruwe gegevens op één plek samen te brengen, waaronder datawarehouses, bedrijfssoftware, mappen op schijven en cloudopslag.

In deze video wordt getoond hoe de gebruiksvriendelijke drag-and-drop-interface van ZohoDataPrep kan worden gebruikt om gegevens uit de 70 verschillende gegevensbronnen te extraheren en samen te voegen.

Het samenvoegen van twee datasets kan worden uitgevoerd met behulp van een van de ingebouwde join-functies. In de „Transform“-fase kunnen validatie-, ontdubbelings- en samenvoegingsregels worden toegepast, evenals verrijkingsstappen.

Hoewel men de software als een ‘no-code’-oplossing kan gebruiken, zijn vaardigheden op het gebied van gegevensbeheer en technisch inzicht in het beheer van enorme datasets een vereiste om deze software voor gegevensopschoning te kunnen gebruiken.

Enkele valkuilen

Er zijn gevallen waarin ZohoDataPrep wellicht niet de ideale oplossing is.

  • Inherente capaciteitsbeperkingen zijn een van de belangrijkste redenen. Dit wordt vermeld in het eigen rapport van Zoho Documentatie over „Beperkingen“. Zo is het maximum aantal kolommen (#) beperkt tot 400 en bedraagt de maximale bestandsgrootte voor het importeren vanuit lokale en andere bestandsformaten 100 MB.

    Hierdoor is de software alleen geschikt voor kleine tot middelgrote gegevensopschoningsprojecten.

  • In sommige gebruikersrecensies op websites zoals G2 en het communityportaal van Zoho wordt vermeld dat de software „buggy“ is als het gaat om het beheer van verschillende gegevenstypen.
    Meerdere velden die met de indelingen „Date“ of „Dropdown“ zijn geïmporteerd, zijn als „TEXT“ geïmporteerd
Recensies:

Scrub.AI

Scrub.AI onderscheidt zich van gangbare ETL- of datavoorbereidingstools doordat het zich specifiek richt op het geautomatiseerd opschonen en verbeteren van de kwaliteit van gegevens met behulp van AI-gestuurde regels.

Terwijl de meeste ETL-platforms een combinatie van handmatige configuratie en het opstellen van regels vereisen, profileert Scrub.AI zich als een zelflerend systeem dat problemen met de gegevenskwaliteit op grote schaal automatisch opspoort en oplost.

Het platform wordt voornamelijk gebruikt door teams die werken met datasets over klanten, leveranciers, producten en transacties, waarbij het verwijderen van dubbele gegevens, het standaardiseren van kenmerken en het opsporen van afwijkingen van essentieel belang zijn.

Het maakt gebruik van AI-modellen die zijn getraind op branchespecifieke datasets om velden automatisch te classificeren, afwijkingen op te sporen en correcties aan te bevelen, met minimale menselijke tussenkomst.

Het platform kan worden geïntegreerd met diverse veelgebruikte databases en cloudtoepassingen, en biedt gebruikers de mogelijkheid om platte bestanden, spreadsheets of API-streams rechtstreeks in één gezamenlijke werkruimte te importeren.

De reinigingsworkflow van Scrub.AI is opgebouwd rond geautomatiseerde profilering, op AI gebaseerde transformaties, patroonherkenning en verrijkingsstappen.

Het systeem signaleert dubbele clusters, ontbrekende waarden, onjuiste formaten en inconsistente attribuutopbouw. Gebruikers kunnen elke door AI gegenereerde aanbeveling tijdens de beoordelingsfase goedkeuren, afwijzen of aanpassen.

Enkele valkuilen

Hoewel Scrub.AI snelheid en automatisering biedt, zijn er situaties waarin het platform tekortschiet:

  • Beperkte controle over de onderliggende logica: Ervaren gebruikers geven soms aan dat de AI-gestuurde aanpak te veel verbergt van wat de tool daadwerkelijk doet. Bij het werken met complexe datasets willen gebruikers wellicht meer transparantie of de mogelijkheid om aannames op systeemniveau te overschrijven.

  • Afhankelijk van de trainingsgegevens: Aangezien de tool in hoge mate afhankelijk is van vooraf getrainde AI-modellen, varieert de nauwkeurigheid ervan per sector. Uit feedback van de gebruikersgemeenschap blijkt dat het platform uitstekend presteert bij klant- of leveranciersgegevens, maar mogelijk moeite heeft met zeer technische of domeinspecifieke kenmerken.

  • Niet ideaal voor zeer grote bestanden of volledige ETL-workflows: Scrub.AI is in de eerste plaats een oplossing voor het opschonen van gegevens, en geen volwaardige tool voor orkestratie of pijplijnen. Teams die behoefte hebben aan planning, versiebeheer, integraties binnen de gehele stack of orkestratie, zullen het wellicht moeten combineren met andere tools.

Scrub.AI is het meest geschikt voor organisaties die behoefte hebben aan AI-ondersteunde verbetering van de gegevenskwaliteit, maar geen volwaardig ETL- of MDM-platform nodig hebben.

Conclusie

Bij het kiezen van een tool voor gegevensopschoning gaat het niet langer alleen om het corrigeren van foutieve records; het gaat om het leggen van een gegevensbasis die daadwerkelijk gelijke tred kan houden met het tempo waarin bedrijven tegenwoordig opereren.

De juiste oplossing moet teams helpen om de overstap te maken van periodieke opruimacties naar een constante, betrouwbare stroom van nauwkeurige informatie die de planning, inkoop en dagelijkse bedrijfsvoering ondersteunt. Naarmate organisaties groeien, wordt deze verschuiving van essentieel belang.

Een gestructureerde aanpak van gegevensopschoning, ondersteund door intelligente automatisering, zorgt ervoor dat de stamgegevens betrouwbaar blijven, vermindert operationele belemmeringen en versterkt uiteindelijk elk systeem dat ervan afhankelijk is.

Over de auteur

Afbeelding van Kumar Gaurav

Kumar Gaurav

Als CEO van Verdantis speelt Kumar een cruciale rol bij het bepalen van de strategische koers van het bedrijf, het uitbreiden van de marktaanwezigheid en het stimuleren van innovatie op het gebied van Master Data Management. Kumar is een doorgewinterde ondernemer en transformatieve leider met meer dan twintig jaar ervaring. Hij is gespecialiseerd in het begeleiden van klanten bij hun digitale transformatie met innovatieve oplossingen. Met een sterke achtergrond in verkoopleiderschap en het beheer van complexe conglomeraten blinkt Kumar uit in het dragen van P&L-verantwoordelijkheid. Hij staat bekend om zijn strategisch advies in de detailhandel, e-commerce en het onderwijs, en om zijn vaardigheid in het op één lijn brengen van diverse belanghebbenden met het oog op gemeenschappelijke doelen binnen matrixorganisatiestructuren.

Gerelateerde berichten

Het bestand downloaden

Uw gegevens zijn bij ons beschermd via onze geheimhoudingsovereenkomst 100%.

Uw gegevens zijn veilig en worden uitsluitend voor de beoogde doeleinden gebruikt. Wij hechten veel waarde aan uw privacy en beschermen uw gegevens.