Reinigungsmethode: Regeln, Standardwerte und Grenzen
Was der lokale Bereiniger tut
Der lokale Bereiniger von HumanFlow wandelt Text mit deterministischen Zeichen- und Musterregeln um. Bei gleicher Eingabe, gleicher aktivierter Regelmenge und gleichen Strichoptionen erzeugt die Engine dieselbe Ausgabe und geordnete Änderungsliste; sie bittet kein Sprachmodell, Bedeutung abzuleiten. Jede Änderung erfasst Regel-ID, Kategorie, Quell- und Ausgabebereiche, entfernten Wert, Ersatzwert, relevante Unicode-Informationen und die Einstufung als destruktiv oder nicht destruktiv.
Sichere Standardregeln zielen auf Formatierungsartefakte, die normalerweise keine Formulierungen ausdrücken: unterstützte verborgene Steuerzeichen, geschützte Leerzeichen, Tabulatoren, wiederholte horizontale Leerzeichen, nachgestellte Leerzeichen und übermäßige Leerzeilen. Optionale Regeln können Markdown oder Zeichensetzung ändern und sind deshalb beim allgemeinen KI-Textbereiniger standardmäßig deaktiviert.
Regelverzeichnis
Die Standardwerte in der Tabelle stammen aus dem Regelverzeichnis der Engine. Seitenspezifische Voreinstellungen können sie überschreiben; die tatsächlichen Voreinstellungen der Startseite und der spezialisierten Werkzeuge für jedes Gebietsschema stehen in der nachfolgend eingefügten Tabelle.
| Regel-ID | Engine-Standard | Risiko | Implementiertes Verhalten |
|---|---|---|---|
hidden-unicode | Ein | Eher sicher, trotzdem prüfen | Entfernt unterstützte C0/C1-Steuerzeichen, Zeichen ohne Breite, Richtungsmarken, Wortverbinder und BOM; gewöhnliche Zeilenumbrüche und Tabulatoren bleiben erhalten. |
normalize-nbsp | Ein | Eher sicher, trotzdem prüfen | Ersetzt U+00A0 NO-BREAK SPACE durch U+0020 SPACE. |
normalize-tabs | Ein | Eher sicher, trotzdem prüfen | Ersetzt Tabulatorzeichen durch normale Leerzeichen. |
collapse-spaces | Ein | Eher sicher, trotzdem prüfen | Fasst wiederholte horizontale Leerzeichen oder NBSP-Folgen zu einem normalen Leerzeichen zusammen. |
trim-trailing-whitespace | Ein | Eher sicher, trotzdem prüfen | Entfernt Leerzeichen und Tabulatoren am Zeilenende. |
collapse-blank-lines | Ein | Eher sicher, trotzdem prüfen | Reduziert Folgen von mehr als einer Leerzeile auf eine Leerzeile. |
remove-markdown-headings | Aus | Destruktiv | Entfernt führende Markdown-Rauten und erhält den Überschriftentext. |
remove-markdown-emphasis | Aus | Destruktiv | Entfernt Sternchen für Hervorhebungen. |
remove-markdown-code-fences | Aus | Destruktiv | Entfernt Zeilen mit dreifachen Backticks und erhält den Inhalt des Codeblocks. |
remove-markdown-links | Aus | Destruktiv | Ersetzt einen Inline-Markdown-Link durch seinen sichtbaren Ankertext und verwirft das Linkziel. |
normalize-smart-quotes | Aus | Destruktiv | Ersetzt typografische einfache und doppelte Anführungszeichen durch ASCII-Anführungszeichen. |
replace-em-dash | Aus | Destruktiv | Ersetzt U+2014 durch den ausgewählten Bindestrich, das Leerzeichen, den Punkt oder eine leere Ausgabe. |
replace-en-dash | Aus | Destruktiv | Ersetzt U+2013 unabhängig davon durch die ausgewählte Ausgabe. |
„Eher sicher“ heißt nicht, dass die Regel für jedes Dokument geeignet ist. Tabulatoren und wiederholte Leerzeichen können Codeeinrückungen oder Tabellenausrichtung darstellen; Zeichen ohne Breite und Richtungsmarken können in mehrsprachigem Text Bedeutung tragen. Jede Regel lässt sich einzeln auswählen, und Rückgängig stellt die im Browserzustand gespeicherte Originaleingabe wieder her.
Überlappungen und Reihenfolge der Änderungen
Die Engine sammelt zunächst Änderungsvorschläge anhand des Originaltexts, sortiert sie nach Quellposition und Regelpriorität und verwirft überlappende Änderungen niedrigerer Priorität. Danach baut sie die Ausgabe von links nach rechts auf und erfasst nach jedem akzeptierten Ersatz die Ausgabebereiche. So bearbeiten mehrere aktive Regeln denselben Quellabschnitt nicht doppelt, und die Quellbereiche bleiben für die Prüfung stabil.
Eine Folge geschützter Leerzeichen kann beispielsweise sowohl der Regel für wiederholte Leerzeichen als auch der Regel für ein einzelnes NBSP entsprechen. Die Engine übernimmt den höher priorisierten Ersatz der Folge und überspringt überlappende Ersetzungen einzelner Zeichen. Für diesen Quellabschnitt wird daher eine statt widersprüchlicher Änderungen gemeldet.
Reproduzierbare Testfälle
Der eingecheckte Testkorpus umfasst leere Eingaben, saubere Prosa, gemischtes Unicode, Markdown, Zeichensetzung, mehrsprachigen Text, Code, JSON und ein großes deterministisches Dokument. Weitere Fälle prüfen exakte Quell- und Ausgabebereiche, die benannte Erkennung von U+200B, Tabulatornormalisierung, den Erhalt von Codeblockinhalten, den Erhalt des Linkankers bei Markdown-Links sowie alle Voreinstellungen spezialisierter Werkzeuge.
Ein Minimalbeispiel ist A[U+200B]B[U+00A0]C. Mit sicheren Standardregeln lautet die erwartete Ausgabe AB C. Ein sauberer Satz mit typografischen Anführungszeichen und Gedankenstrich bleibt bytegenau unverändert, weil Zeichensetzungsregeln deaktiviert sind. Auch eine Markdown-Überschrift bleibt mit sicheren Standardregeln erhalten; der gezielte Formatierungsentferner aktiviert absichtlich seine Markdown-Voreinstellung.
Richtlinien spezialisierter Werkzeuge
Die vier spezialisierten Werkzeuge verwenden dieselbe Engine, statt Transformationen separat umzusetzen:
- ChatGPT-Formatierung entfernen aktiviert Markdown- und Leerzeichenregeln sowie die Behandlung von Codeblöcken und Links.
- Unsichtbare Zeichen entfernen bietet nur Regeln für verborgenes Unicode und NBSP sowie Belege zu Codepunkten.
- Gedankenstriche entfernen bietet getrennte Einstellungen für Gedanken- und Halbgeviertstriche; standardmäßig ist Gedankenstrich zu Bindestrich ausgewählt.
- KI-Abstände korrigieren bietet Regeln für NBSP, Tabulatoren, wiederholte und nachgestellte Leerzeichen sowie Leerzeilen.
Automatisierte Richtlinientests verlangen vier unterschiedliche Signaturen der Standardregeln, genügend einzigartige Inhalte, ein seitenspezifisches Beispiel und eine Ausgabeänderung, wenn jede Voreinstellung ihr eigenes Beispiel verarbeitet. So werden nicht vier Werkzeuge veröffentlicht, die sich nur im Text unterscheiden.
Datenschutzgrenze
Die lokale Bereinigung läuft im Browser; ein Quellcodetest verbietet textübertragende fetch-Aufrufe und Serveraktionen aus der Client-Komponente. Die Zulassungsliste ihrer Analyseereignisse enthält nur aggregierte Regel- und Zähldaten. Der KI-Umschreiber ist eine separate Funktion und kann über den Server übermittelten Text an einen konfigurierten Modellanbieter senden. Auch die Schreibmuster-Prüfung läuft lokal, liefert aber Heuristiken statt Aussagen über Autorenschaft. Siehe Datenschutz des Produkts.
Grenzen
Der Bereiniger kann nicht feststellen, ob ein Text von einem Menschen oder einem Modell stammt. Er kann weder die Entfernung statistischer Wasserzeichen noch bessere Suchplatzierungen oder das Umgehen von KI-Detektoren versprechen und auch nicht nach jeder optionalen Änderung an Zeichensetzung oder Markdown die Bedeutung erhalten. Er erkennt nur die hier dokumentierten Muster. Verschachteltes Markdown, komplexe Linksyntax, eigene Markierungen, Rich-Text-Formatierungen und anwendungsspezifische Zwischenablage-Metadaten können außerhalb dieser Muster liegen.
Prüfen Sie Code, JSON, Tabellen, bidirektionalen Text und sprachspezifische Darstellung in der Zielanwendung. Sichtbare Änderungen und deterministische Ausgabe ermöglichen die Prüfung, ersetzen sie aber nicht.
Version und Änderungsrichtlinie
Die aktuelle Schema-Version der lokalen Formatierungsengine ist 1. Regel-IDs sind stabile API-Werte für Seiteneinstellungen, Analyse-Zulassungslisten, Tests und Governance-Inhalte. Eine Verhaltensänderung muss in derselben Version die erwarteten Testergebnisse und diese Methodik aktualisieren. Neue destruktive Regeln müssen standardmäßig deaktiviert sein. Das Entfernen oder Umbenennen einer Regel erfordert eine ausdrückliche Migration, weil gespeicherte Richtlinien und zentrale SEO-Aufzeichnungen auf diese ID verweisen können.
Diese Methodik wurde zuletzt am 2026-09-05 mit der Repository-Implementierung abgeglichen. Spätere Prüfungsdaten müssen eine tatsächliche Code- und Konfigurationsprüfung wiedergeben und dürfen kein automatisch erzeugter Zeitstempel sein.
Tatsächliche Standardregeln je Seite
Die Tabelle stammt aus der gespeicherten Konfiguration der lokalisierten Seiten. Das Engine-Register aktiviert sechs Formatierungsregeln und deaktiviert sieben Markdown- und Satzzeichenregeln; Seitenvorgaben können sie überschreiben.
| Seitenvorgabe | Standardmäßig aktive Regel-IDs |
|---|---|
| Startseite | trim-trailing-whitespace, collapse-blank-lines |
| KI-Formatierung entfernen | normalize-nbsp, normalize-tabs, collapse-spaces, trim-trailing-whitespace, collapse-blank-lines, remove-markdown-headings, remove-markdown-emphasis, remove-markdown-code-fences, remove-markdown-links |
| Unsichtbare Zeichen entfernen | Keine |
| Geviertstrich entfernen | replace-em-dash |
| KI-Abstände korrigieren | normalize-nbsp, normalize-tabs, collapse-spaces, trim-trailing-whitespace, collapse-blank-lines |