Poradniki

Co laboratoria AI kupują od firm i dlaczego

Laboratoria AI uczą dziś modele wykonywania prawdziwej pracy, od wypełnienia rozliczenia wydatków po rozwiązanie zgłoszenia klienta. Potrzebują do tego zapisów prawdziwej pracy, a te znajdują się głównie w firmach. Oto, co kupują, branża po branży, i co odrzucają.

Dlaczego laboratoria kupują teraz dane prywatne

Pierwsze duże modele językowe uczyły się z publicznego internetu. To źródło jest w dużej mierze wyczerpane i niewiele mówi o tym, jak pracuje się wewnątrz firmy. W 2026 roku laboratoria skupiają się na agentach AI: modelach, które otwierają arkusz, poruszają się po CRM, przygotowują prezentację i sprawdzają własną pracę. Aby trenować i testować takich agentów, laboratoria potrzebują prawdziwych przykładów zadań, kroków wykonanych przez ludzi i wyniku.

To zmienia, co ma wartość. Gotowy raport jest przydatny. Brief, wersje robocze, komentarze i wersja końcowa razem są znacznie bardziej przydatne, bo pokazują drogę.

Procesy firmowe i dane do trenowania agentów

Najszybciej rośnie kategoria danych pokazujących, jak wykonuje się pracę biurową w oprogramowaniu biznesowym. Laboratoria zamieniają te zapisy w zadania dla agentów, ze znanym poprawnym wynikiem do porównania.

  • Rozliczenia wydatków i obsługa faktur, od paragonu do akceptacji.
  • Praca w arkuszach: tabele przestawne, uzgodnienia, budżety i prognozy z zachowanymi formułami.
  • Prezentacje przygotowane na podstawie briefu, wraz z briefem i wersjami roboczymi.
  • Nawigacja w systemach CRM i ERP: utworzenie zamówienia, aktualizacja szansy sprzedaży, zamknięcie sprawy.
  • Zgłoszenia do działu wsparcia rozwiązane od pierwszej wiadomości do końca, łącznie z eskalacjami.

Prywatny kod z historią

Publiczny kod jest szeroko dostępny. Laboratoriom brakuje prywatnego kodu z otaczającym go kontekstem: zgłoszeniem z prośbą o zmianę, dokumentem projektowym, commitami, komentarzami z przeglądu i testami. Razem pozwalają laboratorium budować realistyczne zadania programistyczne ze sprawdzalną odpowiedzią. Szczególnie poszukiwane są systemy legacy, migracje i rzadsze języki programowania.

Rozumowanie ekspertów

Laboratoria chcą uchwycić, jak profesjonaliści myślą o problemie. Jak księgowy zamyka księgi i decyduje, co ująć w rozliczeniach międzyokresowych. Jak prawnik przegląda umowę i wybiera klauzule do negocjacji. Jak analityk kredytowy ocenia wniosek. Jak planista zmienia trasę opóźnionej przesyłki.

To rozumowanie często widać w codziennych zapisach: komentarzach z przeglądów, wewnętrznych wątkach e-mailowych, notatkach decyzyjnych i poprawkach, które doświadczony pracownik wprowadza do pracy młodszego.

Laboratoria cenią wątpliwości tak samo jak odpowiedzi. Wątek, w którym dwoje współpracowników spiera się, jak zaksięgować transakcję, i dochodzi do rozstrzygnięcia, pokazuje modelowi, jak eksperci ważą możliwości.

Procedury, instrukcje i bazy wiedzy

Standardowe procedury operacyjne, instrukcje, materiały wdrożeniowe dla nowych pracowników, listy kontrolne jakości i wewnętrzne bazy wiedzy mówią modelowi, jak zadanie powinno być wykonane i jak to sprawdzić. Laboratoria używają ich zarówno do trenowania modeli, jak i do budowania testów. Firmy często nie doceniają tych materiałów, bo wydają się zwyczajne. Dla laboratorium to spisany opis dobrej pracy.

Dane w mniejszych językach

Większość danych treningowych jest po angielsku. Modele są słabsze po polsku, niderlandzku, szwedzku, czesku, fińsku i w wielu innych językach europejskich, zwłaszcza w zadaniach biznesowych. Zapisów pracy w tych językach jest mało, więc laboratoria płacą za nie więcej. Firma pracująca w dwóch lub trzech językach często ma przewagę, o której nie wie.

Lokalne przepisy dodają wartości. Polska procedura płacowa, szwedzki wzór umowy o pracę czy holenderski wątek o VAT łączą język z wiedzą o krajowym prawie i praktyce. Takie połączenie jest dla laboratorium bardzo trudne do znalezienia gdzie indziej.

Co kupują laboratoria, według branży

Każda branża ma własne cenne zapisy. Kilka przykładów:

  • Biura rachunkowe: listy kontrolne zamknięcia miesiąca, wątki dotyczące uzgodnień, arkusze robocze w Excelu, uwagi z przeglądów i zapytania klientów.
  • Kancelarie prawne: biblioteki klauzul ze stanowiskami awaryjnymi, playbooki przeglądu, przebieg spraw i wewnętrzne notatki badawcze.
  • Firmy IT: prywatne repozytoria z historią, powiązane zgłoszenia, dokumentacja projektowa, postmortemy i runbooki.
  • Doradztwo: briefy w parze z końcowymi prezentacjami, modele analityczne, frameworki i biblioteki ofert.
  • Usługi finansowe: procedury kredytowe, modele finansowe, procesy compliance i szablony raportów.
  • Logistyka: wątki dotyczące obsługi wyjątków, procesy w TMS, WMS i ERP, procedury celne i procedury magazynowe.

Jak laboratoria wykorzystują to, co kupują

Laboratoria wykorzystują dane firmowe na trzy główne sposoby. Pierwszy to trenowanie: model czyta wiele przykładów zadania i uczy się wzorców. Drugi to ewaluacja: laboratoria odkładają zestaw prawdziwych zadań, by sprawdzić, czy nowy model potrafi wykonać pracę. Trzeci to uczenie przez wzmacnianie, w którym model próbuje wykonać zadanie w symulowanym środowisku i jest nagradzany, gdy wynik zgadza się z tym, co zrobił profesjonalista.

Każde zastosowanie wymaga innych danych. Trenowanie korzysta z wolumenu. Ewaluacja wymaga dobrze udokumentowanych zadań z jasną poprawną odpowiedzią. Uczenie przez wzmacnianie potrzebuje zarówno zadania, jak i sposobu sprawdzenia wyniku, dlatego zapisy z widocznym rezultatem, takie jak zamknięte zgłoszenie czy zatwierdzony raport, są bardzo poszukiwane.

Jak laboratoria oceniają jakość

Przed zakupem laboratorium przegląda zanonimizowane próbki. Sprawdza, czy zapisy są kompletne, czy da się prześledzić kroki, ile jest szumu i jak spójny jest format na przestrzeni lat. Pyta też, skąd pochodzą dane i czy sprzedający miał prawo udzielić na nie licencji.

Dobre pochodzenie danych stało się częścią jakości. Zgodnie z unijnym AI Act dostawcy modeli AI ogólnego przeznaczenia muszą publikować podsumowanie danych treningowych. Dlatego laboratoria wolą dane, którym towarzyszy jasny, pisemny opis źródła, zakresu i deidentyfikacji.

Czego laboratoria nie chcą

Laboratoria są wybredne. Niektóre dane nie mają dla nich wartości, a niektórych nie mogą legalnie użyć.

  • Dane osobowe: imiona i nazwiska, dane kontaktowe, dane o zdrowiu i numery identyfikacyjne. Są usuwane lub wyłączane.
  • Dane o niejasnych prawach: pliki należące do klientów, treści objęte NDA i materiały osób trzecich.
  • Szum: newslettery, automatyczne powiadomienia, zaproszenia z kalendarza i duplikaty.
  • Tekst napisany przez narzędzia AI, z którego modele niewiele się uczą.
  • Skany bez czytelnego tekstu.
  • Zapisy bez wyniku, na przykład zgłoszenie, którego nigdy nie zamknięto.
  • Treści już publiczne, które laboratoria w większości przypadków mają.

Jak sprawdzić, czy dane firmy się nadają

Warto zadać cztery pytania. Czy nasze zapisy pokazują zadanie od początku do końca? Czy obejmują kilka lat? Czy pokazują ekspercką ocenę? Czy należą do nas? Jeśli na większość odpowiedź brzmi tak, dane prawdopodobnie zainteresują laboratoria.

Lodex pomaga to sprawdzić przed podjęciem decyzji. Wycena daje pierwszy przedział dla firmy, w granicach €10K–€600K, a krótka rozmowa pokazuje, które źródła laboratoria najchętniej kupią.

Pytania

Czy laboratoria kupują dane od zwykłych firm, czy tylko od dużych platform?

Od jednych i drugich. Duże platformy sprzedają wolumen. Zwykłe firmy sprzedają zapisy prawdziwej pracy, których platformy nie mają, a tego właśnie potrzeba do trenowania agentów.

Czy historia e-maili i czatów jest przydatna?

Tak, gdy pokazuje wykonywaną pracę: decyzje, rozwiązywanie problemów i przekazywanie zadań. Newslettery, powiadomienia i wiadomości towarzyskie są usuwane.

Czy laboratorium wykorzysta moje dane, by zbudować konkurencyjny produkt?

Laboratoria trenują modele ogólne na danych z wielu firm. Lodex udziela licencji wyłącznie laboratoriom AI, nigdy konkurencji, i nic nie jest publikowane.

Czy laboratoria chcą danych w moim języku?

Zwykle tak. Danych firmowych w językach europejskich innych niż angielski jest mało, a laboratoria płacą za nie więcej.

Co, jeśli większość naszych zapisów zawiera dane klientów?

Dane klientów są usuwane podczas przetwarzania. To, co zostaje, czyli kroki, rozumowanie i wynik, jest tym, za co płacą laboratoria.

Cena znana przed sprzedażą.

Trzy pytania o firmę i przedział wypłaty w niecałą minutę.

WycenaRozmowa

Po odpowiedzi na wszystkie trzy pytania pojawi się przedział i możliwość umówienia rozmowy.

  • Każde źródło zatwierdzają Państwo
  • Dane osobowe i dane klientów usunięte
  • Nigdy nie sprzedajemy konkurencji
  • Nic nie jest udostępniane przed podpisem
Sprawdź wycenę