Corpus fixe d’artefacts textuels et rapport de reproductibilité

Corpus sous licence d’échantillons synthétiques pour tester le nettoyeur local sur les caractères invisibles, les espaces, Markdown, la ponctuation et les textes multilingues.
Oct 5, 2026

Question de recherche

Avec des réglages prudents, le moteur de formatage local peut-il supprimer de manière déterministe certains artefacts mécaniques tout en préservant le texte visible propre ? Ce rapport teste uniquement ce comportement limité. Il ne mesure pas l’auteur d’un texte ni ne compare des modèles de langue.

Cette page localise la description d’un corpus fixe existant ; elle ne signifie pas que l’algorithme de nettoyage a été validé séparément pour chaque langue.

Corpus et licence

Les échantillons synthétiques rédigés par le responsable du projet sont publiés sous CC0-1.0 et ne contiennent aucun texte utilisateur. Le corpus comporte les champs prompt, model, model version et generation date. Prompt et model sont explicitement null, car aucun modèle génératif n’a produit ces échantillons.

Télécharger le corpus fixe d’artefacts textuels AnyFormatLocal v1

Méthode

Chaque échantillon fournit une chaîne d’entrée, les identifiants des règles choisies et une sortie attendue exacte. Le test automatisé charge le JSON public, exécute le même moteur local-format-cleaner que le produit et compare les chaînes à l’identique. Les changements proviennent des enregistrements du moteur ; le nombre de caractères correspond à la longueur des chaînes JavaScript.

Identifiants des échantillons

hidden-unicode, nbsp, tabs, repeated-spaces, blank-lines, markdown, punctuation-safe, multilingual

Résultats

Les huit échantillons fixes de la version 1 réussissent le test de reproductibilité du dépôt. Ils couvrent Unicode invisible, espaces insécables, tabulations, espaces répétés, lignes vides excessives, suppression facultative de Markdown, conservation prudente de la ponctuation et texte multilingue. Ce résultat ne vaut que pour ces cas fixes et la version testée du moteur.

Limites

Le corpus est synthétique et volontairement restreint. Il ne représente pas tous les éditeurs, langues, points de code Unicode ou formats de document. Réussir ce test ne signifie pas qu’un texte quelconque est sans erreur, écrit par un humain ou prêt à publier. Ces échantillons fixes ne mesurent pas un taux de détection en conditions réelles et ne jugent pas l’auteur. Consultez la méthodologie pour les risques de chaque règle et vérifiez les changements avec le nettoyeur local.

Reproduire ou signaler une correction

Exécutez la suite de tests du dépôt pour reproduire le test du corpus. Signalez toute erreur d’échantillon, de résultat ou de description à support@ai-text-cleaner.com. Les corrections retenues paraîtront dans une nouvelle version, sans modification silencieuse de v1.

Accueil · Méthodologie · Confidentialité