Guías
Qué compran los laboratorios de IA a las empresas, y por qué
Los laboratorios de IA ya entrenan modelos para hacer trabajo real, desde rellenar una nota de gastos hasta resolver un ticket de soporte. Para ello necesitan registros de trabajo real, que están sobre todo dentro de las empresas. Esto es lo que compran, sector por sector, y lo que rechazan.
Por qué los laboratorios compran datos privados ahora
Los primeros grandes modelos de lenguaje aprendieron de la web pública. Esa fuente está en gran parte agotada y enseña poco sobre cómo se trabaja dentro de una empresa. En 2026 los laboratorios se centran en agentes de IA: modelos que abren una hoja de cálculo, navegan por un CRM, preparan una presentación y revisan su propio trabajo. Para entrenar y evaluar esos agentes, los laboratorios necesitan ejemplos reales de las tareas, los pasos que siguió la gente y el resultado.
Eso cambia lo que se considera valioso. Un informe final es útil. El encargo, los borradores, los comentarios y la versión final juntos lo son mucho más, porque muestran el camino.
Flujos de trabajo empresariales y datos para entrenar agentes
La categoría que más crece son los datos que muestran cómo se hace el trabajo de oficina en el software de gestión. Los laboratorios convierten estos registros en tareas para agentes, con un resultado correcto conocido con el que comparar.
- Notas de gastos y tramitación de facturas, desde el justificante hasta la aprobación.
- Trabajo con hojas de cálculo: tablas dinámicas, conciliaciones, presupuestos y previsiones con sus fórmulas intactas.
- Presentaciones creadas a partir de un encargo, con el encargo y los borradores.
- Navegación en CRM y ERP: crear un pedido, actualizar una oportunidad, cerrar un caso.
- Tickets de soporte resueltos desde el primer mensaje hasta la solución, escalados incluidos.
Código privado con su historial
El código público está muy disponible. Lo que les falta a los laboratorios es código privado con su contexto: el ticket que pidió un cambio, el documento de diseño, los commits, los comentarios de revisión y las pruebas. Juntos permiten a un laboratorio crear tareas de programación realistas con una respuesta verificable. Los sistemas heredados, las migraciones y los lenguajes menos comunes son especialmente buscados.
Razonamiento experto
Los laboratorios quieren captar cómo piensan los profesionales ante un problema. Cómo un contable cierra la contabilidad y decide qué periodificar. Cómo un abogado revisa un contrato y elige qué cláusulas negociar. Cómo un analista de riesgos valora un expediente de crédito. Cómo un planificador redirige un envío que va con retraso.
Este razonamiento suele verse en los registros del día a día: comentarios de revisión, hilos de correo internos, notas de decisión y las correcciones que un sénior hace al trabajo de un júnior.
Los laboratorios valoran las dudas tanto como las respuestas. Un hilo en el que dos compañeros discrepan sobre cómo contabilizar una operación y lo resuelven muestra a un modelo cómo sopesan las opciones los expertos.
Procedimientos, manuales y bases de conocimiento
Los procedimientos operativos, manuales, guías de incorporación, checklists de calidad y bases de conocimiento internas indican a un modelo cómo debe hacerse una tarea y cómo comprobarla. Los laboratorios los usan tanto para entrenar modelos como para crear pruebas. Las empresas suelen infravalorar este material porque les parece corriente. Para un laboratorio es una descripción escrita del trabajo bien hecho.
Datos en idiomas con menos presencia
La mayoría de los datos de entrenamiento están en inglés. Los modelos son más flojos en neerlandés, polaco, sueco, checo, finés y muchas otras lenguas europeas, sobre todo en tareas empresariales. Los registros de trabajo en esos idiomas son escasos, así que los laboratorios pagan más por ellos. Una empresa que trabaja en dos o tres idiomas a menudo tiene una ventaja que no conoce.
Las normas locales suman valor. Un procedimiento de nóminas polaco, una plantilla de contrato laboral sueca o un hilo de consultas sobre el IVA español combinan el idioma con el conocimiento de la ley y la práctica nacionales. Esa combinación es muy difícil de encontrar en otra parte para un laboratorio.
Qué compran los laboratorios, por sector
Cada sector tiene sus propios registros valiosos. Algunos ejemplos:
- Asesorías contables: checklists de cierre mensual, conversaciones de conciliación, papeles de trabajo en Excel, notas de revisión y tickets de consultas de clientes.
- Despachos de abogados: bibliotecas de cláusulas con posiciones de repliegue, guías de revisión, flujos de los asuntos y notas de investigación internas.
- Servicios IT: repositorios privados con historial, tickets enlazados, documentos de diseño, post mortems y runbooks.
- Consultoría: encargos emparejados con presentaciones finales, modelos de análisis, metodologías y bibliotecas de propuestas.
- Servicios financieros: procedimientos de crédito, modelos financieros, flujos de cumplimiento y plantillas de informes.
- Logística: hilos de gestión de incidencias, flujos de TMS, WMS y ERP, procedimientos aduaneros y procedimientos de almacén.
Cómo usan los laboratorios lo que compran
Los laboratorios usan los datos empresariales de tres formas principales. La primera es el entrenamiento: el modelo lee muchos ejemplos de una tarea y aprende los patrones. La segunda es la evaluación: los laboratorios reservan un conjunto de tareas reales para comprobar si un nuevo modelo sabe hacer el trabajo. La tercera es el aprendizaje por refuerzo, en el que un modelo intenta una tarea en un entorno simulado y recibe una recompensa cuando el resultado coincide con lo que hizo un profesional.
Cada uso favorece datos distintos. El entrenamiento se beneficia del volumen. La evaluación necesita tareas bien documentadas con una respuesta correcta clara. El aprendizaje por refuerzo necesita tanto la tarea como una forma de comprobar el resultado, por eso los registros con un resultado visible, como un ticket cerrado o un informe aprobado, tienen mucha demanda.
Cómo juzgan la calidad los laboratorios
Antes de comprar, un laboratorio revisa muestras censuradas. Comprueba si los registros están completos, si los pasos se pueden seguir, cuánto ruido hay y si el formato es coherente a lo largo de los años. También pregunta de dónde vienen los datos y si el vendedor tenía derecho a cederlos.
La procedencia se ha convertido en parte de la calidad. Según el Reglamento Europeo de IA, los proveedores de modelos de IA de uso general deben publicar un resumen de sus datos de entrenamiento. Por eso los laboratorios prefieren datos que vienen con un registro escrito y claro de su origen, su alcance y su desidentificación.
Qué no quieren los laboratorios
Los laboratorios son selectivos. Algunos datos no tienen valor para ellos y otros no los pueden usar legalmente.
- Datos personales: nombres, datos de contacto, datos de salud y números de identificación. Se eliminan o se excluyen.
- Datos con derechos poco claros: archivos propiedad de clientes, contenido bajo acuerdos de confidencialidad y material de terceros.
- Ruido: newsletters, notificaciones automáticas, invitaciones de calendario y duplicados.
- Textos escritos por herramientas de IA, que enseñan poco a los modelos.
- Documentos escaneados sin texto legible.
- Registros sin resultado, como un ticket que nunca se cerró.
- Contenido que ya es público, que los laboratorios tienen en la mayoría de los casos.
Cómo saber si sus datos encajan
Hágase cuatro preguntas. ¿Nuestros registros muestran una tarea de principio a fin? ¿Cubren varios años? ¿Muestran criterio experto? ¿Son nuestros? Si la respuesta a la mayoría es sí, es probable que sus datos interesen a los laboratorios.
Lodex le ayuda a comprobarlo antes de comprometerse. La estimación da un primer rango para su empresa, dentro de €10K–€600K, y una llamada breve muestra qué fuentes suyas tienen más probabilidades de comprar los laboratorios.
Preguntas
¿Los laboratorios compran datos a empresas normales o solo a grandes plataformas?
A ambas. Las grandes plataformas venden volumen. Las empresas normales venden registros de trabajo real que las plataformas no tienen, que es lo que necesita el entrenamiento de agentes.
¿Sirve el historial de correo y chat?
Sí, cuando muestra trabajo en marcha: decisiones, resolución de problemas y traspasos. Las newsletters, las notificaciones y los mensajes personales se eliminan.
¿Usará un laboratorio mis datos para crear un producto que compita conmigo?
Los laboratorios entrenan modelos generales con datos de muchas empresas. Lodex solo cede datos a laboratorios de IA, nunca a su competencia, y nada se publica.
¿Quieren los laboratorios datos en español?
Normalmente sí. Los datos empresariales en lenguas europeas distintas del inglés escasean, y los laboratorios pagan más por ellos.
¿Y si la mayoría de nuestros registros contienen datos de clientes?
Los datos de clientes se eliminan durante el procesamiento. Lo que queda, los pasos, el razonamiento y el resultado, es lo que pagan los laboratorios.