Preparación de datos para IA

Cuando tu asistente de IA no encuentra los documentos, el problema casi nunca es la IA.

Es que tus documentos no son legibles para ella. Un PDF escaneado es una imagen: para un sistema de IA no contiene ni una palabra. Mido cuánto de tu archivo está en esa situación y te lo digo con cifras, no con impresiones.

  • 0llamadas a internet durante el análisis, verificado por test
  • 1.000páginas por muestra, en castellano
  • 24-48 hdesde que recibo la muestra hasta el informe
  • 160pruebas automáticas en verde sobre la herramienta

Qué se mide

Cinco cosas, sobre una muestra de tus documentos reales. Cada una responde a una pregunta que hoy contestas por intuición.

Documentos que no se pueden leer

Un PDF corrupto, un .docx que no abre. Para un asistente de IA, un documento que no abre sencillamente no existe.

Cobertura de extracción

El porcentaje de páginas con texto realmente extraíble. Un PDF escaneado sin OCR es invisible para un sistema de recuperación: es la causa más común de «la IA no encuentra lo que le pido».

Exposición de datos personales

Recuento por tipo, separando los identificadores con formato verificable —DNI, NIE, IBAN, tarjeta, número de la Seguridad Social— de las menciones que solo propone el modelo de lenguaje.

Fragmentación

Cuántos fragmentos se generan al trocear el texto, cuántos quedan demasiado cortos y cuántos están repetidos. Predice de antemano una recuperación pobre.

Variación de tokens al anonimizar

Cuánto texto movió la anonimización. Va en anexo, y el informe declara expresamente que no es un ahorro de coste: puede salir negativa.

Ver las cinco en detalle →

Qué mide cada una exactamente, con qué parámetros, y qué decisión tuya desbloquea.

Ningún documento sale de tu equipo

Es la razón por la que este análisis se puede hacer sobre expedientes que nunca subirías a una nube.

La garantía, y lo que la sostiene

Todo el análisis corre en local: no hay llamadas a internet ni claves de API en ningún punto del proceso. Lo sostiene una prueba automática que intercepta cualquier intento de abrir una conexión durante un análisis completo y falla si ocurre.

Se puede ejecutar delante de quien lleve vuestros sistemas, antes de tocar un solo fichero.

Cómo se verifica, en detalle →

Cómo se trabaja

Cuatro pasos. El trabajo pesado es elegir la muestra, y lo eliges tú.

  1. Eliges la muestra

    La carpeta o el expediente que os parezca menos sensible. Hasta 1.000 páginas en castellano, en .pdf, .docx o .txt.

  2. El análisis se ejecuta en local

    En tu equipo o delante de vosotros. Sin subir nada, sin claves de API y sin que el proceso abra una sola conexión.

  3. Recibes el informe en 24-48 horas

    Dos ficheros que se quedan en tu máquina: el informe y sus datos en bruto, para que puedas rehacer cualquier cifra.

  4. Lo repasamos

    Te digo qué hallazgos bloquean de verdad lo que queréis montar y cuáles son ruido. Si no hay nada que merezca la pena, también te lo digo.

Lo que este análisis no hace

Ponerlo por delante es parte del método. Un informe que no declara sus límites no es un informe, es publicidad.

No estima con qué frecuencia se equivoca tu IA

Mide el estado de los documentos, no el comportamiento del modelo.

No hace OCR y no arregla nada

Detecta las páginas sin texto extraíble; no las convierte. El informe diagnostica: limpiar y estructurar el archivo es un trabajo aparte.

¿Encaja tu caso?

Escribe y te digo, sin compromiso, si sí o si no. Si no encaja, te lo digo también: cuesta un cliente y gana la única credibilidad que tengo.