固定文本瑕疵语料库与可复现性报告
研究问题
在安全设置下,本地格式引擎能否确定性地移除指定的机械性瑕疵,同时保持干净的可见措辞不变?本报告只测试这一狭窄行为,不衡量 AI 作者身份,也不比较语言模型。
本页是对既有固定语料的本地化说明;它不表示清理算法已针对每种语言分别验证。
语料库与许可
维护者编写的合成样本以 CC0-1.0 发布,不含用户文本。语料记录 prompt、model、model version 和 generation date 字段;由于没有生成式模型参与,prompt 和 model 字段明确为 null。
下载 AnyFormatLocal 固定文本瑕疵语料库 v1
方法
每个样本包含输入字符串、所选规则 ID 和精确预期输出。自动化测试读取公开 JSON,运行产品使用的同一 local-format-cleaner 引擎,并逐字比较字符串。变更数量来自引擎的变更记录;字符数按 JavaScript 字符串长度计算。
样本标识符
hidden-unicode, nbsp, tabs, repeated-spaces, blank-lines, markdown, punctuation-safe, multilingual
结果
版本 1 的八个固定样本均通过仓库中的可复现性测试。样本涵盖隐藏 Unicode、不换行空格、制表符、重复空格、多余空行、选择性 Markdown 移除、安全保留标点和多语言文本。该结果仅适用于这些固定案例及受测引擎版本。
局限
语料是合成且刻意保持小规模,不能代表所有编辑器、语言、Unicode 码点或文档格式。通过测试不意味着任意文本没有错误、由人类撰写或可安全发布。固定样本不代表现实中的检出率,也不构成作者身份判断。请参阅方法说明了解各规则风险,并使用本地清理器检查修改。
复现或报告更正
运行仓库测试套件即可执行语料测试。如发现样本、结果或说明有误,请联系 support@ai-text-cleaner.com。接受的更正会发布为新的语料版本,不会静默修改 v1。