Payroll Data Audit

🧮 智能薪酬合规审核·8阶段流水线

企业级工资数据审核系统,基于确定性规则引擎实现95% SOP覆盖率,支持8阶段流水线审核、动态交互看板及总审核报告生成,确保薪酬合规零差错。

收藏
3.9k
安装
958
版本
7.1.0
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

核心用法

Payroll Data Audit 是一款专为企业薪酬合规设计的自动化审核系统,采用"确定性操作下沉到代码,模糊推理留给LLM"的架构原则。系统全量对齐《工资审核标准流程SOP》6步流程,对飞书/SAP/ADP导出的工资表执行自动化合规校验,SOP覆盖率达95%(41/43项)。

典型使用流程
1. 数据扫描确认(强制):执行data_scan.py获取发薪月分布、公司主体、计薪项汇总、特殊人员识别等关键信息,用户确认无误后方可进入正式审核

2. 完整审核流水线:通过run_full_pipeline.py一键执行8阶段审核——数据扫描→规则引擎→报告生成→动态看板→抽样校验→问题清单→总审核报告→文件交付

3. 分段审核(大数据量场景):使用run_audit.py实现7阶段独立执行+断点续传,避免上下文截断

4. 快速场景:支持红线校验(10秒快检)、字段检查、公式校验等独立场景

显著优点

1. 规则引擎高度可配置
所有规则集中在references/rules.json管理,支持红线(4条,触发即阻断)、黄线(6条,标记解释)、蓝线(4条,仅提示)、业务规则(5项)、政策豁免(多项)的灵活扩展,新增规则无需修改Python代码。

2. 数据支撑原则严格执行
每个审核结论必须附带检查数、通过数、阈值三要素。例如:"公式校验通过:2000条记录全部在0.01元容差范围内,通过率100%"。异常结论需列出具体人员、工号、异常值、预期值、违反规则ID。

3. v6.x版本重大升级

  • 表格化报告:替代v5卡片+SVG风格,信息密度大幅提升
  • 动态交互看板:零依赖纯内嵌JS,支持筛选/排序/搜索/展开明细/导出CSV/深色模式
  • 三者联动机制:报告↔看板↔数据索引通过rule_id双向锚定,确保数据一致性
  • 连续在职人员环比分析:自动识别连续在职人员,排除实习生/当月入离职/近期调薪转正/请假>2天/多主体发薪人员,对比12项计薪科目环比变化,自动标记>10%异常波动并分类原因
  • 总审核报告(Master Report):聚合数据扫描、审核结果、判定过程、问题清单、抽样校验为一份完整HTML报告
  • 文件交付自动化:11个必发文件清单+审核结论摘要自动生成

4. 精准排除逻辑
v7.1修复5个P0阻断bug,优化全角/半角括号统一、新员工排除+上月1号调薪豁免、实习生排除等关键逻辑,显著降低误报率。

潜在缺点与局限性

1. 适用范围受限
明确不覆盖:实际算薪操作、薪酬市场调研、个税计算、社保核算。纯算薪场景需切换至专用算薪工具。

2. 数据源依赖
优先依赖飞书/SAP/ADP导出格式,虽内置40+字段别名变体(COLUMN_ALIAS),但极端非标列名仍可能识别失败,需人工映射。

3. 红线阻断的刚性
一旦触发红线(实发≤0、加班超36h、低于最低工资、社保未缴),立即阻断后续所有步骤。虽符合合规要求,但紧急场景下可能缺乏"先出报告后整改"的弹性选项。

4. 跨月对比的基准依赖
无上月数据时,跨月对比/按人分析自动跳过,报告中标注"无基准数据",部分趋势分析能力受限。

适合人群

  • HR薪酬团队:月度发薪前的合规校验,确保零差错发放
  • HRIS/系统管理员:飞书/SAP/ADP系统的数据质量监控
  • 财务审核人员:薪酬总额的合理性复核与波动分析
  • 审计合规团队:薪酬政策的执行合规性审计
  • 大型企业多主体场景:支持分主体/分四级部门对比,适配复杂组织架构

常规风险

数据安全风险:工资数据为敏感个人信息,需确保执行环境的数据隔离与传输加密。建议在企业内网或私有云环境部署,避免使用公共LLM API直接处理原始工资数据。

误判风险:虽v7.1大幅优化排除逻辑,但特殊场景(如跨月调薪生效日期边缘情况)仍可能产生误报,需人工复核黄线/蓝线标记项。

断点续传的数据一致性风险:使用--resume分段审核时,需确保源数据文件未被修改,否则可能导致阶段间数据不一致。

精度容差边界风险:金额计算使用decimal.Decimal,公式校验容差0.01元。极端情况下(如大规模数据累加),分毫级误差可能影响通过率判定。

安全解读

核心用法

payroll-data-audit 是一款专为企业 HR 和财务团队设计的工资数据自动化审核系统,采用"确定性操作下沉到代码,模糊推理留给 LLM"的架构原则。系统全量对齐《工资审核标准流程 SOP》六步流程,对飞书、SAP、ADP 等主流 HR 系统导出的工资表执行深度合规校验,SOP 覆盖率达 95%(41/43 项)。

使用流程严格遵循强制三步:首先执行 data_scan.py 进行数据扫描,输出发薪月分布、公司主体、计薪项汇总、特殊人员识别等关键信息;等待用户确认"确认无误"后方可进入正式审核;最终通过 run_full_pipeline.py 一键执行端到端流水线,生成表格化报告、动态交互看板、数据支撑索引、总审核报告等 11 个必发文件。系统支持 7 阶段分段审核(断点续传)、快速红线校验(10 秒完成)、抽样校验二次确认等多种使用模式。

显著优点

规则引擎专业严谨:内置 4 条红线(实发≤0、加班超 36h、低于最低工资、社保未缴)、6 条黄线(绩效异常、出勤超限、工资波动等)、4 条蓝线(跨月趋势提示),所有规则集中管理于 rules.json,支持零代码扩展。v7.1 修复 5 个 P0 阻断 bug,包括全角/半角括号统一、新员工排除、实习生排除等关键场景。

数据质量保障完善:采用 decimal.Decimal 进行金额计算,杜绝浮点误差;公式校验容差精确到 0.01 元;内置 40+ 字段别名映射,兼容各类工资表格式;连续在职人员环比分析自动排除实习生、当月入离职、调薪转正、请假>2 天等干扰因素,标记 12 项计薪科目 >10% 异常波动。

输出体系完整可用:v6 版本升级为表格化报告,信息密度高;动态交互看板支持筛选/排序/搜索/导出 CSV/深色模式,零依赖纯内嵌 JS;data_index.json 作为三者联动核心,确保报告、看板、原始数据双向锚定;总审核报告聚合全部输出,可直接用于审计留档。

潜在缺点与局限性

数据源依赖性强:必须提供 CSV/Excel 格式的工资数据,且跨月对比功能强制要求上月数据,无上月数据时部分分析能力降级。对飞书多维表格、SAP HCM、ADP 导出的格式兼容性较好,但自定义格式可能需要人工调整列名映射。

本地化部署门槛:需要 Python 3 环境及 pandas/numpy/openpyxl 依赖,非技术团队部署存在学习成本。虽支持 Docker 化,但官方未提供容器镜像,需自行打包维护。

规则适配成本:尽管规则集中管理,但企业个性化政策(如特定行业最低工资、地区社保政策差异)仍需手动编辑 rules.json,缺乏可视化规则配置界面。政策豁免逻辑(如道旅国际特殊处理)已硬编码,其他企业需二次开发。

性能瓶颈待验证:官方未公开大规模数据性能基准,3000+ 人员企业的全量审核耗时、内存占用未知。分段审核设计虽缓解上下文截断,但大数据量场景下 Phase 7 总报告生成可能存在延迟。

适合的目标群体

  • 中大型企业 HR/薪酬团队:月度发薪前合规检查,替代人工逐行核对
  • 财务共享中心:多主体、多账套工资的集中审核与风险管控
  • 审计与内控部门:薪酬数据稽核、抽样校验、问题追踪与整改闭环
  • HR SaaS 厂商:作为增值服务模块集成,提升产品专业度
  • 劳务派遣与外包机构:批量审核多个客户企业的工资数据合规性

常规风险提示

性能风险:全量审核涉及 12 项计薪科目 × 多个月份 × 多主体的矩阵运算,极端数据量下可能触发内存溢出。建议采用 --step 参数分步执行,或启用 run_audit.py 分段模式。

依赖项风险:pandas 2.0+ 与 numpy 1.24+ 的版本兼容性需持续关注,升级依赖后建议执行完整回归测试。openpyxl 处理大体积 Excel 文件时速度较慢,CSV 格式为推荐输入。

数据质量风险:列名容错虽覆盖 40+ 变体,但非标工资表仍可能触发 Missing column 错误。建议建立企业级字段映射模板,或要求数据源方标准化导出格式。

误报与漏报风险:排除逻辑(如 YL-006 跨月调薪豁免)基于固定规则,复杂人事场景(月中多次调薪、跨主体借调)可能误判。建议结合人工复核,特别是对标记为"需核实"的个案。

输出文件管理风险:生成的 HTML/JSON/Markdown 报告包含员工敏感信息,需确保存储路径受控、访问权限最小化、按组织数据保留政策及时归档或删除。

Payroll Data Audit 内容

references文件夹
scripts文件夹
tests文件夹
手动下载zip · 93.2 kB
rules.jsonapplication/json
请选择文件