Gidsen
Wat AI-labs van bedrijven kopen, en waarom
AI-labs trainen modellen nu om echt werk te doen, van een declaratie invullen tot een supportticket afhandelen. Daarvoor hebben ze vastleggingen van echt werk nodig, en die zitten vooral binnen bedrijven. Dit is wat ze kopen, per sector, en wat ze afwijzen.
Waarom labs nu besloten data kopen
De eerste grote taalmodellen leerden van het openbare web. Die bron is grotendeels opgebruikt en leert weinig over hoe werk binnen een bedrijf gaat. In 2026 richten labs zich op AI-agents: modellen die een spreadsheet openen, door een CRM navigeren, een presentatie opzetten en hun eigen werk controleren. Om die agents te trainen en te testen, hebben labs echte voorbeelden nodig van de taken, de stappen die mensen zetten en het resultaat.
Dat verandert wat waardevol is. Een af rapport is nuttig. De briefing, de concepten, het commentaar en de eindversie samen zijn veel nuttiger, omdat ze de weg laten zien.
Bedrijfsprocessen en trainingsdata voor agents
De snelst groeiende categorie is data die laat zien hoe kantoorwerk in zakelijke software wordt gedaan. Labs maken van deze gegevens taken voor agents, met een bekende juiste uitkomst om tegen te controleren.
- Declaraties en factuurverwerking, van bon tot goedkeuring.
- Spreadsheetwerk: draaitabellen, aansluitingen, begrotingen en prognoses met de formules intact.
- Presentaties die vanuit een briefing zijn gemaakt, met de briefing en de concepten.
- Navigatie in CRM- en ERP-systemen: een order aanmaken, een deal bijwerken, een zaak afsluiten.
- Supporttickets die van eerste bericht tot oplossing zijn afgehandeld, inclusief escalaties.
Besloten code met haar historie
Openbare code is ruim beschikbaar. Wat labs missen, is besloten code met de context eromheen: het ticket dat om een wijziging vroeg, het ontwerpdocument, de commits, het reviewcommentaar en de tests. Samen laten die een lab realistische programmeertaken bouwen met een controleerbaar antwoord. Legacysystemen, migraties en minder gangbare programmeertalen zijn extra gewild.
Hoe experts redeneren
Labs willen vastleggen hoe professionals een probleem doordenken. Hoe een accountant de boeken afsluit en bepaalt welke posten moeten worden toegerekend. Hoe een advocaat een contract beoordeelt en kiest over welke clausules te onderhandelen. Hoe een kredietbeoordelaar een kredietdossier weegt. Hoe een planner een vertraagde zending omleidt.
Die redenering is vaak zichtbaar in alledaagse gegevens: reviewcommentaar, interne e-mailthreads, besluitnotities en de correcties die een senior in het werk van een junior aanbrengt.
Labs waarderen de twijfels net zo hoog als de antwoorden. Een thread waarin twee collega's het oneens zijn over hoe een transactie moet worden geboekt en er samen uitkomen, laat een model zien hoe experts opties afwegen.
Procedures, draaiboeken en kennisbanken
Werkinstructies, draaiboeken, inwerkhandleidingen, kwaliteitschecklists en interne kennisbanken vertellen een model hoe een taak moet worden gedaan en hoe die te controleren. Labs gebruiken ze om modellen te trainen en om tests te bouwen. Bedrijven onderschatten dit materiaal vaak omdat het gewoon voelt. Voor een lab is het een geschreven beschrijving van goed werk.
Data in kleinere talen
De meeste trainingsdata is Engels. Modellen zijn zwakker in het Nederlands, Pools, Zweeds, Tsjechisch, Fins en veel andere Europese talen, vooral bij zakelijke taken. Werkgegevens in die talen zijn schaars, dus labs betalen er meer voor. Een bedrijf dat in twee of drie talen werkt, heeft vaak een voordeel waarvan het zich niet bewust is.
Lokale regels maken het nog waardevoller. Een Poolse salarisprocedure, een Zweeds sjabloon voor een arbeidscontract of een Nederlandse thread over een btw-vraag combineert taal met kennis van nationaal recht en de praktijk. Die combinatie vindt een lab vrijwel nergens anders.
Wat labs kopen, per sector
Elke sector heeft eigen waardevolle gegevens. Een paar voorbeelden:
- Accountancy: checklists voor de maandafsluiting, uitzoekwerk bij aansluitingen, werkdossiers in Excel, reviewnotities en klantvragen.
- Advocatuur: clausulebibliotheken met terugvalposities, review-playbooks, dossierworkflows en interne onderzoeksmemo's.
- IT-dienstverlening: private repositories met historie, gekoppelde tickets, ontwerpdocumenten, postmortems en runbooks.
- Advies: briefings met de bijbehorende eindpresentaties, analysemodellen, frameworks en offertebibliotheken.
- Financiële dienstverlening: kredietprocedures, financiële modellen, compliance-workflows en rapportagesjablonen.
- Logistiek: afhandeling van verstoringen, workflows in TMS, WMS en ERP, douaneprocedures en werkinstructies voor het warehouse.
Hoe labs gebruiken wat ze kopen
Labs gebruiken bedrijfsdata op drie manieren. De eerste is training: het model leest veel voorbeelden van een taak en leert de patronen. De tweede is evaluatie: labs houden een set echte taken apart om te testen of een nieuw model het werk aankan. De derde is reinforcement learning, waarbij een model een taak probeert in een gesimuleerde omgeving en wordt beloond als het resultaat overeenkomt met wat een professional deed.
Elk gebruik vraagt om andere data. Training heeft baat bij volume. Evaluatie vraagt om goed gedocumenteerde taken met een duidelijk juist antwoord. Reinforcement learning vraagt om beide: de taak en een manier om de uitkomst te controleren. Daarom is er veel vraag naar gegevens met een zichtbaar resultaat, zoals een gesloten ticket of een goedgekeurd rapport.
Hoe labs kwaliteit beoordelen
Voor de aankoop bekijkt een lab geschoonde voorbeelden. Het controleert of de gegevens compleet zijn, of de stappen te volgen zijn, hoeveel ruis er is en hoe consistent het formaat over de jaren is. Het vraagt ook waar de data vandaan komt en of de verkoper het recht had om haar in licentie te geven.
Een goede herkomst is onderdeel van kwaliteit geworden. Onder de AI-verordening moeten aanbieders van AI-modellen voor algemene doeleinden een samenvatting van hun trainingsdata publiceren. Labs geven daarom de voorkeur aan data met een duidelijke, schriftelijke vastlegging van bron, scope en verwijderde gegevens.
Wat labs niet willen
Labs zijn selectief. Sommige data heeft voor hen geen waarde, en sommige mogen ze wettelijk niet gebruiken.
- Persoonsgegevens: namen, contactgegevens, gezondheidsgegevens en identificatienummers. Die worden verwijderd of uitgesloten.
- Data met onduidelijke rechten: bestanden van klanten, inhoud onder geheimhouding en materiaal van derden.
- Ruis: nieuwsbrieven, automatische meldingen, agenda-uitnodigingen en dubbelingen.
- Tekst die door AI-tools is geschreven, waar modellen weinig van leren.
- Gescande documenten zonder leesbare tekst.
- Gegevens zonder uitkomst, zoals een ticket dat nooit is gesloten.
- Inhoud die al openbaar is, want die hebben labs meestal al.
Zo ziet u of uw data past
Stel vier vragen. Laten onze gegevens een taak van begin tot eind zien? Beslaan ze meerdere jaren? Tonen ze deskundig oordeel? Zijn ze van ons? Is het antwoord op de meeste vragen ja, dan is uw data waarschijnlijk interessant voor labs.
Lodex helpt u dit te toetsen voordat u zich vastlegt. De schatting geeft een eerste bandbreedte voor uw bedrijf, binnen €10K–€600K, en een kort gesprek laat zien welke van uw bronnen labs het liefst kopen.
Vragen
Kopen labs data van gewone bedrijven of alleen van grote platforms?
Allebei. Grote platforms verkopen volume. Gewone bedrijven verkopen vastleggingen van echt werk die platforms niet hebben, en dat is wat het trainen van agents nodig heeft.
Is de historie van e-mail en chat nuttig?
Ja, als die laat zien hoe het werk wordt gedaan: beslissingen, probleemoplossing en overdrachten. Nieuwsbrieven, meldingen en persoonlijke berichten worden verwijderd.
Gebruikt een lab mijn data om een product te bouwen dat met mij concurreert?
Labs trainen algemene modellen op data van veel bedrijven. Lodex levert alleen aan AI-labs, nooit aan uw concurrenten, en er wordt niets gepubliceerd.
Willen labs data in het Nederlands?
Meestal wel. Bedrijfsdata in andere Europese talen dan het Engels is schaars, en labs betalen er meer voor.
Wat als de meeste van onze gegevens klantgegevens bevatten?
Klantgegevens worden tijdens de verwerking verwijderd. Wat overblijft, de stappen, de redenering en de uitkomst, is waar labs voor betalen.