← 返回项目经历
设备核验 · VLM 信息抽取

设备铭牌信息抽取:在效果、算力与复核之间取舍

AI Engineer · 模型微调、部署与评估

01目标

从现场设备铭牌图像中抽取制造年份与厂商,支持后续设备核验。模糊、反光或标签缺失时,系统应保留不确定性,对无法确认的信息返回空值,而不是补全一个看似合理的答案。

我负责数据准备、VLM 微调、云端部署与效果和成本评估。目标是形成可重复评估的结构化抽取链路,并说明它与人工复核怎样配合。

02输入

  • 现场采集的铭牌图片,覆盖不同清晰度、反光和信息完整程度。
  • 制造年份、厂商等字段标注,以及用于独立评估的参考答案。
  • 可用于 LoRA 微调的训练数据与不同规模的多模态模型。
  • GCP GPU 环境、Docker 运行配置、显存与云端成本约束。

训练可行性是技术选型的一部分。更大的模型若无法在目标资源内完成微调,就不能只凭规模成为默认方案。

03用户流程

以下按设备核验任务梳理使用路径,描述的是抽取与复核链路:

  1. 输入现场铭牌图片。
  2. 模型输出规定格式的制造年份与厂商,无法确认的字段保留为空。
  3. 进行年份格式标准化,将模型结果与核验数据对齐。
  4. 对缺失、模糊或疑似错误的结果回看原图,由人工复核。
  5. 将失败类型记录下来,作为数据补充和下一轮评估的依据。

04输出

我整理了 LoRA 数据集,建立结构化输出、年份标准化、Ground Truth 对齐、批量推理和错误样本复盘链路。

在 GCP VM 与 Docker 环境中完成 Qwen2.5-VL-3B 的 LoRA 微调和复现实验。由于较大模型受显存限制,选型同时考虑模型能力、训练可行性与云端成本。

评估中分别检查双字段精确匹配、年份正确性和厂商正确性,把失败样本归回模糊、反光、标签不全等输入条件,支持客户判断哪些结果可用、哪些需要复核。

05任务边界

  • 任务聚焦指定字段的图像信息抽取,不等同于设备安全检查或设备身份的最终认证。
  • 模型输出是核验辅助信息;输入不足时不推断缺失字段。
  • 我的贡献覆盖数据、模型微调、运行环境和评估,不将整个设备核验业务的结果归为模型能力。
  • 公开案例不包含客户原图、内部字段记录和具体实验指标。

06验收标准

以下为项目评估口径,未披露客户正式验收阈值:

  • 输出字段与格式一致,年份标准化规则明确,空值处理可检查。
  • 训练与独立评估数据分开,分别报告联合字段与单字段表现,避免总分掩盖具体问题。
  • 模糊、反光与标签不全等失败条件有样本依据,人工复核范围清楚。
  • 在记录的 GPU 与容器环境中复现推理和评估,并说明资源需求。

07迭代

先定义什么叫“抽取正确”,再建立数据、推理与参考答案对齐的链路。随后根据显存限制调整模型规模,完成可运行的微调实验,最后用独立样本检查效果并复盘错误。

后续优化应针对失败类型补充数据,比较质量收益与资源投入。可解释的错误分类和明确的空值策略,与平均准确率同样影响系统是否适合业务使用。

客户信息已匿名化 · 仅展示个人参与范围
向 Agent 了解更多 →