Skip to content

【案例】启衡精密:证据优先的百炼票据 OCR 评测 #54

Description

@2487238628

【案例】启衡精密:证据优先的百炼票据 OCR 评测

我做了什么

我从“启衡精密 AI 财务提效 POC”中抽出了一条可以公开复现的最小链路:对同一张 GPT-image-2 生成的合成住宿票据,使用百炼 CLI 分别调用 qwen3-vl-plusqwen3.5-ocrqwen3.6-flash,比较字段提取、JSON 输出契约、耗时、Token 和关键安全标签。

项目重点不是让模型自动审批,而是验证一个更容易被忽略的问题:OCR 即使读对文字,也可能把数值返回为字符串、漏掉“非真实发票”标签、用 Markdown 包裹 JSON,或重复输出字段。任何缺字段、冲突或契约失败都会转人工复核,模型不修改 ERP 状态。

使用的工具

  • 百炼 CLI:bailian-cli 1.12.0
  • 百炼模型:qwen3-vl-plusqwen3.5-ocrqwen3.6-flash
  • 百炼能力:视觉理解、OCR 候选字段提取、结构化输出
  • Skill:qiheng-finance-review 的证据优先审核方法
  • 其他:PowerShell、SHA-256、GPT-image-2 合成测试票据

效果展示

同图、同提示词、同字段的真实结果:

模型 墙钟耗时 核心字段 JSON 契约 关键观察
qwen3-vl-plus 14.048 秒 8/8 通过 数值类型有效,识别合成标签
qwen3.5-ocr 13.735 秒 8/8 未通过 Markdown 包裹、数值字符串化、漏合成标签
qwen3.6-flash 20.195 秒 8/8 未通过 数量类型错误、标签重复、产生额外推理 Token

本轮继续把 qwen3-vl-plus 作为下一测试集的临时基线,但不根据一张合成票据宣称生产准确率或模型绝对优劣。

公开仓库:https://github.com/2487238628/qiheng-evidence-first-ocr

仓库包含合成票据、冻结字段、真实运行证据、三模型对比和一键重跑脚本,不包含真实发票、员工信息、税号、银行账号、ERP 数据或 API Key。

踩坑记录

  1. 第一次只完成了百炼控制台登录,但 OCR 脚本需要的是 DASHSCOPE_API_KEY;两种认证不能混为一谈。
  2. 首次复制 API Key 未成功,重新通过本机安全输入窗口保存;密钥没有进入聊天或运行日志。
  3. 将两个模型放进同一个 PowerShell 循环时没有返回可检查输出,因此该次记为 UNVERIFIED,随后逐模型重跑并保留真实耗时。
  4. 更新或专用模型没有自动胜出:qwen3.5-ocr 读对了主要字段,但没有遵守 JSON 类型和安全标签契约。
  5. Windows 默认编码读取 UTF-8 JSON 时产生过假失败,验证脚本改为显式 -Encoding UTF8

项目边界

该案例只证明:百炼 CLI 的多模型票据候选字段链路可以真实运行,并可通过确定性门禁发现结构化输出问题。它不证明生产准确率、生产 SLA、真实 ROI、自动审批或无人值守财务处理能力。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions