NYMQUILL / DOCUMENTATION

一份清楚的使用说明。

先用虚构材料走一遍完整流程,了解识别、复核和导出的边界,再决定如何将缄页用于你的日常工作。

当前为 0.1.0 开发测试版,协议 1.23。产品中文名称为“缄页脱敏”,简称“缄页”,英文名称为 Nymquill。安装后的桌面程序与本网站使用相同的产品名称。本页更新于 2026-09-09。

安装与首次使用

  1. 从首页下载 Windows x64 MSI 测试包,下载前查看版本说明和 SHA-256。安装包尚未商业签名,完整的安装、升级、卸载与业务验收仍待完成。
  2. 安装并打开桌面程序,确认页面显示本地引擎可用。安装包内置中文识别与 OCR 模型,核心处理无需另外安装 Python 或联网下载模型。
  3. 创建或打开本地工作区,以保存项目审阅和稳定代号。若只需一次性处理文字,可使用临时会话;临时会话不会持久保存代号映射。
  4. 先导入一份虚构或非敏感材料,识别后逐项复核、生成预览,并把新副本导出到单独目录。

当前提供 Windows x64 候选包,目标为 Windows 10 / 11。尚未提供 macOS 或 Linux 构建。

前往下载测试版 ↓

识别与人工审阅

“中文模型+规则”会结合本地模型、格式规则和上下文,产生姓名、机构、地址及其他敏感信息候选。也可以主动选择“规则与上下文”。模型损坏时会明确报错。

  1. 核对整份原文,逐项确认或忽略已有命中;模型分数不代表正确概率。
  2. 使用搜索定位重复内容,对漏检文字补标;页面材料也可人工框选。
  3. 选择稳定代号、完全遮盖或受支持的部分遮盖方式,并检查冲突候选。
  4. 完成审阅后生成预览,再导出验证通过的副本。没有自动命中也需要检查原文,并明确确认是否无需处理。

OCR 可能漏字、错字或没有识别出任何文字。请结合原页面逐页检查。网站首页的交互演示只使用固定虚构样例,不运行实际识别模型。

文件与导出格式

输入材料当前处理方式
DOCX识别正文、表格、页眉页脚及脚注等受支持文字。导出新的 DOCX 或文字副本;分页和排版可能变化。
PDF / 扫描 PDF按需提取文字或执行本地 OCR;导出扁平图像安全 PDF,或不保留版式的文本 / Markdown。
PNG / JPGOCR 识别后审阅,可添加人工区域,导出安全 PDF。包含人工区域时禁止文本导出。
TXT / Markdown读取 UTF-8 文本,识别、审阅后导出文本副本。

暂不支持 DOC、DOCM、Excel、CSV、PPT、CAD。含图片、修订、公式、嵌入对象或内容控件等复杂 DOCX 会被拒绝;不提供 PDF 转可编辑 Word。

代号替换与还原

在同一工作区中,相同文字的同类型实体可沿用稳定代号。例如,陈建华对应〈人物1〉,后续材料中再次出现时可保持一致。两处同名实际代表不同人时,可手动拆分代号。

外部 AI 返回内容后,在原工作区打开“代号还原”,粘贴文本或导入 TXT / Markdown。核对已知代号及出现次数,选择要还原的项,预览后复制或导出结果。当前不支持 DOCX 格式还原。

稳定代号是可逆的假名化,不等于匿名化。不要把工作区与脱敏副本一起交给外部接收方。工作区依赖当前 Windows 用户保护,不能直接复制到另一台电脑恢复。

项目与处理记录

可把多份材料加入同一加密工作区,保存导入队列、识别结果和审阅记录。失败项可重试,中断之后可重新打开继续。扫描期间暂不能同时审阅。

按实体分组查看重复命中后,可选择同实体决定的应用范围。跨文档修改会让相关文档重新进入需要预览的状态,生成新预览后才能再次导出。

批量导出记录可在重启后核对与重试。重试创建新输出,不覆盖已有结果。已有审阅依赖源文件路径与哈希;源文件缺失或改变时,需要重新导入核对。

当前版本边界

  • 识别可能漏检、误标或边界不准。当前模型评测以小规模合成样例为主,不能作为真实业务准确率宣传。
  • 不自动识别人脸、签名、印章、指印、二维码或 Logo,需要人工框选。
  • 地名候选不等于完整地址;相同名称分组不做同名消歧、机构简称或曾用名自动归并。
  • 页面文件最多 512 MB,PDF 最多 200 页;单张图片最多 80 MP。DOCX 最多 50 MB,提取文字最多 2 MB。
  • 导入队列最多 200 条记录,不支持文件夹递归导入。安全 PDF 为扁平图像,文件可能较大且没有可编辑文字层。
  • 导出验证针对已确认内容及结构,不证明未识别信息已经处理。对外发送前仍需人工核对。
  • 干净系统安装升级、真实桌面全流程、Word 版式及可访问性人工验收尚未完成。

本展示站不提供云端文件上传、账号注册或在线付款。当前没有公开承诺商业价格、服务等级或业务识别准确率。