Trazabilidad de los datos de entrenamiento bajo el Reglamento europeo de IA
La trazabilidad es la respuesta documentada a dos preguntas: ¿de dónde proceden estos datos de entrenamiento y qué derecho tiene usted a usarlos? Bajo el Reglamento europeo de IA, cuyas obligaciones se aplican de forma escalonada desde 2025, los proveedores de IA deben poder responder a ambas por escrito.
- La obligación
- Un resumen suficientemente detallado del contenido usado para el entrenamiento
- Datos por scraping
- Sin cadena de titularidad, no hay resumen que nadie pueda respaldar
- En TGDC
- Verificación de derechos por corpus, anonimización comprobada por lote
Qué exige el Reglamento
Los proveedores de modelos de IA de uso general deben mantener documentación técnica sobre sus datos de entrenamiento y publicar un resumen suficientemente detallado del contenido utilizado, junto con una política de respeto del derecho de autor de la Unión, incluidas las reservas de derechos manifestadas por los titulares. Los proveedores de sistemas de IA de alto riesgo están sujetos a deberes de gobernanza sobre los conjuntos de datos con los que entrenan. Todas estas obligaciones apuntan en la misma dirección. Una recolección web no puede aportar lo que piden, porque registra lo que se tomó y no lo que estaba permitido. Reguladores, clientes y tribunales esperan cada vez más una cadena documentada que lleve de cada conjunto de datos a una autorización.
Obtenido por scraping frente a licenciado
- Los datos obtenidos por scraping no tienen cadena de titularidad. Su situación en materia de derecho de autor está discutida, las oposiciones son difíciles de atender con efecto retroactivo, y su contenido está, por construcción, ya dentro de todos los modelos competidores.
- Los datos licenciados llegan con una respuesta por escrito a la pregunta de la procedencia: de quién eran, quién autorizó su uso, qué se pagó y qué condiciones los acompañan. La documentación que pide la regulación es sencillamente parte de la entrega.
Qué significa «con derechos verificados» en TGDC
Cada corpus que entrega The General Data Company lleva consigo su procedencia:
- Cadena de titularidad por escrito, desde la autorización en origen hasta la licencia que firma el comprador. En el origen está el mandato de un administrador concursal, una grabación consentida de un flujo de trabajo o el consentimiento de un particular en la aplicación.
- Verificación de derechos por corpus sobre titularidad, material de terceros y límites legales, antes de entregar nada.
- Informes de anonimización por lote que acreditan que las entidades nombradas, los datos personales y los identificadores comerciales se eliminaron o se seudonimizaron, y se verificaron.
Un laboratorio que entrena con un corpus así puede incorporar a su documentación técnica una historia de obtención documentada, en lugar de la descripción de una recolección. Cuando más adelante un auditor o un cliente pregunte de dónde salió un conjunto de datos, la respuesta será una cadena de titularidad por escrito y no una conjetura. Véase licencias de datos para el detalle de producto, o masas concursales para el funcionamiento del canal fundacional.
Una breve lista de comprobación para equipos de IA
- ¿Puede nombrar la fuente jurídica de cada conjunto de datos de entrenamiento: una licencia, un mandato, un consentimiento?
- ¿Resistiría esa historia de obtención el hecho de quedar escrita en la documentación técnica de su modelo?
- ¿Sus conjuntos de datos llegan con pruebas de anonimización o de tratamiento de datos personales, por lote y no como promesa del proveedor?
- Si mañana pregunta un titular de derechos o un regulador, ¿cuánto tardaría la respuesta?
Ninguna de estas preguntas se vuelve más fácil una vez terminado el entrenamiento. Si alguna respuesta resulta incómoda, esa es justamente la brecha que cierra una licencia con derechos verificados: hello@thegeneraldata.com.