Corpus fijo de artefactos de texto e informe de reproducibilidad

Corpus con licencia de muestras sintéticas para probar el limpiador local con caracteres invisibles, espacios, Markdown, puntuación y texto multilingüe.
Oct 5, 2026

Pregunta de investigación

¿Puede el motor de formato local eliminar de forma determinista ciertos artefactos mecánicos y conservar intacta la redacción visible cuando se usan ajustes seguros? Este informe examina únicamente ese comportamiento acotado. No mide la autoría de IA ni compara modelos lingüísticos.

Esta página localiza la descripción de un corpus fijo existente; no indica que el algoritmo de limpieza se haya validado por separado para cada idioma.

Corpus y licencia

Las muestras sintéticas, redactadas por el responsable del proyecto, se publican bajo CC0-1.0 y no contienen texto de usuarios. El corpus registra campos de prompt, model, model version y generation date. Prompt y model son null de forma explícita porque no se utilizó ningún modelo generativo.

Descargar el corpus fijo de artefactos de texto AnyFormatLocal v1

Método

Cada muestra incluye una cadena de entrada, los identificadores de las reglas seleccionadas y una salida esperada exacta. La prueba automatizada carga el JSON público, ejecuta el mismo motor local-format-cleaner que usa el producto y compara las cadenas carácter por carácter. Los cambios se cuentan mediante los registros del motor; los caracteres, según la longitud de cadenas de JavaScript.

Identificadores de las muestras

hidden-unicode, nbsp, tabs, repeated-spaces, blank-lines, markdown, punctuation-safe, multilingual

Resultados

Las ocho muestras fijas de la versión 1 superan la prueba de reproducibilidad incluida en el repositorio. Cubren Unicode invisible, espacios de no separación, tabulaciones, espacios repetidos, líneas vacías excesivas, eliminación opcional de Markdown, conservación segura de puntuación y texto multilingüe. El resultado solo respalda esos casos fijos y la versión probada del motor.

Limitaciones

El corpus es sintético e intencionadamente pequeño. No representa todos los editores, idiomas, puntos de código Unicode ni formatos de documento. Superar la prueba no significa que cualquier texto esté libre de errores, sea humano o se pueda publicar sin revisión. Las muestras fijas no representan tasas de detección en el mundo real ni permiten juzgar la autoría. Consulta la metodología sobre los riesgos de cada regla y revisa los cambios con el limpiador local.

Reproducir o comunicar una corrección

Ejecuta la suite de pruebas del repositorio para reproducir la prueba del corpus. Comunica errores en una muestra, resultado o descripción a support@ai-text-cleaner.com. Las correcciones aceptadas se publicarán en una nueva versión, sin modificar v1 en silencio.

Inicio · Metodología · Privacidad