# 同类对比与未来方向：实验说明

实验日期：2026-09-23。

## 本次实际完成

1. 6 张历史案例的 GPT 红线已转换成原尺寸 0/255 二值掩码，保存原生成图和叠回真正原图的结果。
2. 从已有联合训练池中，按样本编号固定选取 CFD、DeepCrack、UAV-CrackX4 各 1 张。选取发生在推理之前，没有按成绩挑图。
3. 每张训练图调用内置 image_gen 图像工具一次。输入仅为原图，要求按实际可见宽度填满裂缝区域；没有给人工标签、模型预测或人工提示点，也没有挑选多次生成结果。后端具体模型标识未由工具公开。
4. 重跑旧 v1.1、当前 v1.7、候选 v2.22，并单列 v1.7 加自动道路筛选后的结果。SAM 3、Gemini、Qwen 只做官方能力梳理，尚无本项目同图实测。

## 三张训练样本的逐图算术平均

|方法|IoU|Dice|Precision|Recall|
|---|---:|---:|---:|---:|
|旧 v1.1 全图|58.11%|73.00%|77.20%|69.77%|
|当前 v1.7 全图|68.93%|81.56%|76.62%|88.00%|
|当前 v1.7 自动道路|65.31%|78.94%|76.10%|83.71%|
|候选 v2.22（未发布）|70.12%|82.40%|77.94%|87.66%|
|GPT 生成区域转掩码|69.24%|81.80%|80.87%|83.06%|

GPT 区域生成转掩码在这三张图上得到了有竞争力的结果，具备作为标注初稿或候选方案继续验证的价值。这不是全体模型排名：样本数仅 3，选自本项目训练池，各版本历史训练暴露不同，GPT 的预训练数据暴露未知。

此前两张已有验证图的 GPT 输出使用“细红线”提示，本次仅固定提取其描线进行局部诊断。新旧提示用的样本不同，不构成严格提示词消融。

## 从生成图到掩码

固定提取规则为 R≥160 且 R−G≥70 且 R−B≥70。先提取生成分辨率下的掩码，再使用最近邻映射回原图宽高。未做膨胀、腐蚀、补洞、连通块过滤、标签调参或几何纠偏。提取掩码是生成图的派生结果，不称为模型原生概率掩码。完整英文提示词保存在各案例 prompt.txt。

背景特征匹配记录中位数与 95 分位像素位移，作为生成图整体几何对齐的诊断，不用于改变评分掩码，也不能证明局部裂缝边界都正确。生成可能改动背景，比较叠加图始终使用真正的原始照片。

## 量测口径与限制

IoU、Dice、Precision、Recall 均按同尺寸二值掩码计算。无标签图不计算准确率，掩码面积占比不叫精度。标签阈值：CFD 和 DeepCrack ≥128；UAV-CrackX4 原标签为 0/1，≥1。输入保持原始比例和原始像素。

面积是全掩码像素数。主路径长度、主路径最大宽度复用网站 measurement.measure_main_crack，在全图区域下运行，未指定物理尺度。该程序先选主连通分支，再用骨架最长测地路径与距离变换量测；它不是全部分支总长。断开/连接可能改变选中的分支，不能把其偏差直接解释成同一条真实裂缝的物理误差。最大宽度对交叉处、标签宽度和边界截断敏感。

DeepCrack 样本 GPT 面积偏差约 −0.71%，主路径长度相对标签约 +80.51%；候选模型也出现主路径增大。这说明区域面积接近不能替代连通关系复核。UAV 标签的几何精细程度也不能直接当作物理宽度真值。

同样本中，当前 v1.7 全图 IoU 为 71.62%，自动道路筛选后为 60.77%，说明最终漏检可能来自道路筛选。相机与路面尺度尚未标定，全部长度、宽度与面积只以 px / px² 表示。

本地推理参数：CPU FP32，512 分块，25% 重叠，不启用 TTA，按各自 checkpoint 固定阈值二值化。候选模型没有替换线上模型。本次未修改推理、阈值、权重或服务进程。

## 汇报时的说法

“我们先把视觉上很好的生成标注变成可计算的二值掩码，再与人工标签和专用模型做同图比较。在三张已有训练样本上，GPT 区域生成转掩码的平均 IoU 为 69.24%，当前裂缝模型全图为 68.93%，研究候选为 70.12%。这说明生成标注值得研究，但三张训练图不足以说明谁的泛化能力更强。量测结果还受局部边界、断点连接、主分支选择以及物理标定影响，因此下一阶段要同时验证像素分割和几何量测。”

## 下一阶段建议

- 固定模型和训练设置，分别测试标签清理、场景补样、原始比例恢复的贡献，避免把全部提升归给更高清数据。
- 固定原图、提示方式、阈值和几何算法，补测 SAM 3 与 Gemini；人工点框条件与全自动条件单列。
- 对相同裂缝分支建立精细标签与尺度标定，增加边界、连通、长度、宽度和面积误差。
- 按道路和采集批次划分独立测试，记录重复运行稳定性、耗时与资源。开发选择与最终验收分离。

## 官方资料（2026-09-23 核对）

- [SAM 3：实际 masks 输出与 SAM 3.1 更新](https://github.com/facebookresearch/sam3)
- [Gemini：结构化分割轮廓输出](https://ai.google.dev/gemini-api/docs/image-understanding#segmentation)
- [OpenAI：图像理解中的精确定位与缩放限制](https://developers.openai.com/api/docs/guides/images-vision)
- [Qwen3-VL：视觉理解与定位能力](https://github.com/QwenLM/Qwen3-VL)
- [CrackSAM：基础模型的裂缝领域适配](https://arxiv.org/abs/2312.04233)

能力会随版本更新，更新重点也可能是视频跟踪或效率，不能据此推断细裂缝量测排名。以上未来方向是本项目建议，未作为已实现或已验证效果展示。
