AI 公文智能优化助手

开源链接:GitHub - linhut/document-ai-assistant

基于国家标准 GB/T 9704 的公文格式智能检测与修复 —— 应用本地化、数据本地化、多模型选换。

项目简介

在日常的公文写作和审核工作中,我发现绝大多数人(包括我自己)写出来的公文格式多多少少都有不规范的地方——字号不对、行距偏差、标题层级混乱、页码格式错误等等的这些问题,单个看起来不起眼,但积少成多,严重影响公文的严肃性和专业性。人工逐项对照标准去检查,效率极低且容易遗漏。

本项目基于 GB/T 9704-2012《党政机关公文格式》国家标准,开发了一套本地运行的桌面应用,只需上传 .docx 公文文件,系统自动完成格式检测、问题定位和一键修复,全程数据不离开本机。同时集成了 AI 能力,支持对公文内容进行智能润色和优化建议。

核心痛点

经过大量实际使用感受,在日常文档类工作中总结出最头疼的四个问题:

  1. 格式规范记忆困难:GB/T 9704 标准涉及字体、字号、行距、页边距、标题层级、页码、版记等很多的细则,普通人根本记不全,每次都要找模板对照,效率极低。
  2. 人工审核效率低下:一份文档动辄十几页,逐段逐句对照格式标准人工审核,耗时耗力且容易遗漏,尤其是正文中的小标题层级、附件标注、抄送格式等细节。
  3. 修改成本高:发现格式问题后,手动修改 Word 文档经常牵一发动全身——改了标题字号,行距又不对了;调了页边距,页码位置又偏了。反反复复调整,一份公文能改半小时。
  4. AI 辅助不好用:虽然市面上有很多 AI 写作工具,但针对公文格式规范的工具很少,准确率也低,而且大多需要收费,生成的内容格式依然不合规。

解决方案

针对以上痛点,我构思设计了一套全链路自动化的解决方案:

1. GB/T 9704 全标准规则引擎

预置完整的国标格式检测规则,覆盖公文处理全流程:

  • 版头检测:份号、密级、紧急程度、发文机关标志、发文字号、签发人等
  • 主体检测:标题格式(二号小标宋)、主送机关、正文字号(三号仿宋)、行距(28.95 磅固定值)、各级小标题等
  • 版记检测:抄送机关、印发机关、印发日期的格式和位置
  • 页面设置:上边距 37mm、下边距 35mm、左边距 28mm、右边距 26mm、页码格式(— X —)

以上所有规则以 YAML 配置,支持三级优先级覆盖:官方标准 < 自定义规范 < 用户偏好,灵活适配不同单位的个性化要求。

2. 八大公文文种专项适配

针对不同类型公文的格式差异进行专项处理:通知、请示、报告、函、会议纪要、决定、通告、公告。

  • 每种文种有独立的格式校验规则和模板
  • 自动识别文种类型,应用对应的检测规则
  • 支持上行文(请示/报告)和平行文(函)的格式差异

3. AI 多模型可选换

集成 AI 能力对公文内容进行智能优化:

  • 插件化设计:支持多家主流模型,切换零成本
  • 内容润色:AI 辅助优化公文措辞、语句通顺度、逻辑连贯性
  • 隐私安全:API Key 使用 Fernet 加密本地存储,所有文件处理在本地完成,不依赖网络

4. 一键检测 + 一键修复

极简操作流程,降低使用门槛:

  1. 上传 .docx → 自动解析文档结构
  2. 规则引擎全量检测 → 生成问题报告
  3. 一键修复所有问题 → 导出规范文档

技术分层:

  • 解析层python-docx 深度解析文档 XML 结构,提取每个段落的完整样式信息
  • 检测层RuleEngine 对 DocumentModel 执行全量规则检查,按优先级排序输出问题列表
  • 修复层RuleEngine.check_and_fix() 一键修复所有可自动修复的问题
  • 输出层generator.generate_docx() 生成符合标准的新文档,保持原文内容不变

下一步更新计划

  • 程序将支持国产系统环境,可在信创环境打开软件使用相关功能
  • 程序将对公文红头多样式规则进行补充
  • 优化在线 A4 文档编辑使用体验

本文最初发布于 LINUX DO