淘沙 GoldPan · 找图与清洗,一条管线

给标签
就还你一个干净的图片池

没有图?按你的标签从公网找。有数据集但很脏?机器洗全量、人只审难例。无论图从哪来,交付的都是可直接训练的干净图片池。

访问码制 · 本地大模型零 API 成本 · 数据不出机
淘沙 · 任务详情
139下载图
25clean keep
2隔离
19VLM keep
4 级漏斗逐级提纯,成本逐级升高
2 行业农业病害与车险定损实战跑通
0 错收终审原则:宁漏杀,不错收
95%机器自动完成,人只审难例
THE PROBLEM

建一个能用的图片池,为什么这么难

连 ImageNet 都有 6% 错标(NeurIPS 2021 实测)——你的数据集只会更脏

自己爬写脚本、过反爬、查扩展名,折腾两天,爬回来的图三分之一是截图、广告和电商图标
全员人工挑一万张图看一周,看到后面标准全飘——前面放过的,后面又删了
外包标注按张计费还不懂你的类别边界——他们分不清的,恰恰是你行业里才懂的差别,返工率是家常便饭
TWO WAYS IN

无论图从哪来,交付的都是干净图片池

同一条清洗终审管线,服务两种起点

入口 A · 我没有图

按标签从公网找图建库

给标签和特征描述,图库/网页双渠道聚合候选,规则+CLIP 粗洗、VLM 终审、人工复核,几天交付垂直图片池——不用写一行爬虫。

新建找图任务 →
入口 B · 我有脏数据集

存量数据清洗与终审

爬图交叉错标、众包标注不一致、重复低质图混入——VLM 大模型逐张终审,错标剔除、嫌疑进人工、每张图附判定轨迹,拿回一个干净子集。

了解清洗服务 →
WORKFLOW

四级漏斗,逐级提纯

每一级只处理上一级通过的图,成本逐级升高、精度逐级提高

公网搜图

图库 + 网页双渠道,多语言查询词,MD5 去重与垃圾黑名单

规则 + CLIP 清洗

尺寸/比例/二维码规则,CLIP 正负判定词零样本筛除垃圾图

VLM 级联终审

大模型逐张提问「是 / 否 / 不确定」,只收特征明显的图

人工复核导出

拿不准的进人工队列,丢弃图回流黑名单,一键导出

HUMAN IN THE LOOP

机器洗全量,人只审难例

人工复核工作量降一个量级——人只出现在机器没把握的地方

机器做 95%

  • 双渠道聚合全网候选图,MD5 全局去重
  • 规则过滤:尺寸 / 比例 / 二维码 / 黑白图
  • CLIP 零样本筛除截图、广告、插画、电商图
  • VLM 大模型逐张级联终审:是 / 否 / 不确定
  • 垃圾黑名单:丢过的图永不复活

人只做 5%

  • 只复核机器判「不确定」的难例
  • 裁定类别边界的边界 case
  • 首波候选抽看,确认方向后放量
  • 终审纠错,校准下一轮判定词
FEATURES

为垂直领域而生

通用标注平台假设你已经有数据——我们解决的是"数据从哪来、怎么洗干净"

领域一键切换

换领域只换一份 JSON 配置:CLIP 判定词、VLM 提问脚本、阈值,不写代码

模型先判,人只判疑难

VLM 级联提问当裁判,「不确定」进人工队列——和 Encord 的人找图相反

本地模型零成本

CLIP + Qwen3-VL 全部本机推理,无 API 费用,数据不出机,可私有化

双渠道采集

图库搜索 + 网页正文提图,中英文/学名多语言查询词,命中率数倍于单渠道

人工复核闭环

✓✗ 一键复核,丢弃图 MD5 自动回流全局黑名单,垃圾图不再复活

干净的导出物

keep 池 + 逐图判定报告(JSONL)打包下载,可直接进训练或向量库

USE CASES

这些团队,都在按标签建图片库

找图建库和存量清洗,是被反复验证的真需求

保险科技车损定损图库

新损伤类型、新车型覆盖慢,历史理赔图攒不齐长尾

Tractable 在用同类数据训练定损 AI
农业 AI病虫害识别样本

公开集多是白底摆拍,和田间实拍差距大,真样本难攒

PlantVillage 数据集 · 淘沙实战场景
工业质检缺陷检测数据集

缺陷样本稀缺且靠人工拍摄分拣,攒一个能用的要几个月

Landing AI 面向制造业的核心场景
零售科技货架识别训练集

货架图拍摄成本高、SKU 上新快,训练集永远滞后

Trax 分析数十亿张货架照片
内容平台审核样本库

违规样本敏感难获取,对抗样本随内容生态不断变化

Hive 靠专有样本库训练审核模型
电商零售商品图库与同款检索

"实拍图-商品图"配对数据的清洗是主要成本

阿里拍立淘千万级日 UV
科研保护物种识别照片集

稀有物种照片少、专家鉴定贵,长尾物种几乎没数据

iNaturalist 每类 100 图才能入模型
AI 数据团队存量数据集清洗

爬图交叉错标、众包不一致、重复低质图混入

ImageNet 都有 6% 错标(NeurIPS 2021)
QUALITY

凭什么说图是干净的

每条纪律都来自真实跑批踩过的坑,不是纸上规则

垃圾黑名单,丢过就不再复活

所有被丢弃图的 MD5 进全局黑名单,电商图标、二维码、广告图不会在下次搜图时重新混进来——池子越用越干净

宁漏杀,不错收

VLM 拿不准的一律进人工队列,宁可人看 10 张不可错收 1 张;自动丢弃只留给高置信判断

措辞只写可见形态

终审提问不用术语、不问对象种类,只写 2D 图上可直接观察的特征——这是十余轮校准踩出来的硬纪律

每张图都有判定轨迹

每张图的级联问答逐问留档(JSONL),交付时随池附赠——任何一张收录图都能回溯"为什么收"

TEMPLATES

开箱即用的领域模板

模板沉淀了经过实测校准的判定词与提问脚本,也可以展开后改成你的领域

农业病害

14 套定稿级联:白叶枯、穗颈瘟、纹枯、叶瘟、赤霉……经过十余轮措辞校准,0 错收

汽车划痕

车险定损/车况检测场景,针对新车广告图、海报、玩具车专项负向判定词

SERVICES

技术服务 · 企业数据管线定制

你把标签给我们,我们把干净图片池给你——机器做 95%,人只处理难例

按标签定制图片数据集

给标签和特征描述,交付清洗+终审后的干净图片池,附逐图判定报告(JSONL),可直接进训练或向量库

数据管线搭建与私有化部署

找图 → 清洗 → 终审 → 复核整条管线部署到你的服务器,含领域配置调优(判定词/级联脚本校准)

存量数据清洗与终审

你已有图片池但标签脏:错标定位、垃圾图隔离、VLM 逐张复核,改标优先于删除,嫌疑清单逐条留档

管线工具定制开发

在现有管线基础上按你的业务加环节:新数据源、定制判定模型、与你内部系统对接

1
加微信说需求

标签清单 + 参考图(有最好),工作日 24 小时内回复

2
联系试用

开通试用账号,或直接小批量试跑你的标签,先看效果

3
出方案和报价

试跑命中率确认后定方案,报价按实际工作量

4
定制管线

按你的领域配置调优并放量跑批,交付 keep 池 + 判定报告

15391540056手机 / 微信同号 · 加微信聊需求
FAQ

常见问题

关于数据质量、终审机制和版权边界

公网爬来的图有多少是错标或垃圾图?

按关键词爬图的预期错标率在 20%~40%(电商图标、截图、广告、缩略图占大头);连学界常用基准测试集都平均有 3.4% 错标(NeurIPS 2021 研究)。淘沙用规则过滤 + CLIP 零样本 + VLM 大模型三级清洗,机器拿不准的一律进人工复核,不把脏图放进交付池。

VLM 终审是什么?准确率如何?

VLM 终审是用视觉大模型对每张图做级联提问——每问只答「是 / 否 / 不确定」,全部通过才收录。提问只写图上 2D 可见的形态、不用术语,这是十余轮校准踩出来的硬纪律。原则是宁漏杀不错收:拿不准的进人工队列。在农业病害场景实战校准后,终审 0 错收。

我已经有图片数据集但标签很脏,能只做清洗吗?

可以,存量数据清洗是独立服务:错标定位、垃圾图隔离、VLM 逐张复核、改标优先于删除(错标的稀有样本往往正是你缺的数据),每张图附判定轨迹(JSONL),任何一张收录或剔除都可回溯原因。数据集全程留在你自己的环境。

公网图片的版权怎么处理?

公网图片的版权与使用授权归原权利人。淘沙提供的是采集与清洗的技术管线;将图片用于模型训练等用途前,请按你的使用场景自行确认授权边界。我们会主动说明这一点,而不是回避。

合规边界,先说清楚:公网图片的版权与使用授权归原权利人,淘沙提供的是采集与清洗的技术管线;将图片用于模型训练等用途前,请按你的使用场景自行确认授权边界。存量清洗服务中,你的数据集全程留在你的环境,我们不出售、不留存客户数据。

开始建你的第一个图片池

输入访问码,三步跑通全链路

淘沙 GoldPan 搜图 → 清洗 → 终审 → 复核 → 导出
{{ {dashboard:'工作台',tasks:'任务列表',new:'新建任务',detail:'任务详情',admin:'管理后台'}[view] }}
{{ maskPhone(user.phone) }} 退出登录