You need to agree to share your contact information to access this dataset

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Released for research use; access granted manually. State your name, affiliation, and intended use.

Log in or Sign Up to review the conditions and access this dataset content.

GenCAD-Code — 图像 → CadQuery 代码(唯一 raw-direct 的 CAD 集

已转为团队统一 7 字段 SFT schema。任务:给一张 CAD 渲染图,生成能造出它的 CadQuery 代码。 (配套模型叫 CAD-Coder,论文 arXiv:2505.14646。)

🟢 这个集不用渲染,可以直接喂 VLM —— 但图是 JPEG 不是 PNG

image 列自带真实图像字节(源库就是 struct<bytes, path>)。它是黄色组 CAD 半边 唯一一个真正 raw-direct 的数据集 —— 其余(MFCAD / MFInstSeg / FeatureNet / DeepCAD / ABC …) 都是 STEP / STL / 构造序列,必须先渲染。

编码注意:HF parquet 里的图是 JPEG,不是 PNG。本次转换逐行做了 magic-bytes 运行时校验, 实测格式:PNG 163,671 行。PNG 版本只存在于 GitHub repo(anniedoris/CAD-Coder)—— 同一份数据两种编码,训练/评测混用两个来源时要注意。

🔴 登记表里这一行有两处错

  1. 名字错了。 登记表写 "CAD-Coder" —— 那是模型名。数据集真名叫 GenCAD-CodeCADCODER/GenCAD-Code)。
  2. raw_direct 写反了。 登记表写 NO,**实测是 YES**(图像已内嵌,见上)。

⚠ 行数与外部说法对不上(本库以实测为准)

split 行数(实测)
train 147,289
validation 8,204
test 7,355
none 823
合计 163,671

参照系:HF datasets-server 声明 3 个 split 共 162,848 行(train 147,289 / validation 8,204 / test 7,355);上游 split.csv 共 163,671 行;论文写 163,671、val 9,027(把 none 的 823 行计进了 validation)。微信里提到的 156,954 跟哪个口径都对不上(与 163,671 差 6,717)。 本库不采信任何一边,只报实测值,差异待组会核对口径。

none split:本次运行确实从源库拉到了它,但它不在源库声明的 split 里 —— 保留并标注。 实际拉到 data/none-00000-of-00001.parquet(3,178,731 字节,实测 823 行), 本库保留为独立 split、未并入 train(并入会改变已声明的划分)。但注意:HF datasets-server /size 只声明 train/validation/test 三个 split(共 162,848 行),官方转换脚本 gencadcode_to_hf.py 也用 if split_name != "none" 把它排除在推送之外 —— 它是个 未声明 的文件。none 对应上游 split.csv 的第四个取值(823 行,官方代码注释指向 渲染图缺失);论文把这 823 计进 validation,所以论文写 163,671 / val 9,027。

源 parquet 实测合计 728,213,069 字节;3 个已声明 split(4 个 parquet 文件)的声明字节数合计 725,034,338 字节

转换时跳过的行(运行时统计):空 image 0 行;cadquery 为 null/空串(防止产出空 annot target)0 行。

⚠ 用之前先自己去重(test 内部实测 11.4% 逐字节重复)

核查抽样 test 前 2,000 行复算:1,848 个唯一 CadQuery 串、227 行(11.4%)落在重复组、最大重复组 17 次;旗舰 100 评测子集成员 0016/00167991 就在一个大小为 8 的重复组里。train↔test 跨 split 泄漏没人验证过(旁证:CADBench 用同一份 test split 时明说先做了去重和单体过滤)。 本库原样保留源库的行与划分、未做去重 —— 当 SFT 语料用之前需自行去重。

⚠ 每个模型只有一张图,别拿上游 _1~_4 做多视角增强

本集每行只有一张 448×448 等轴测渲染图(对应上游的 {id}_0.png,未缩放视角)。上游还有 _1~_4 四张 —— 那是把实体沿 xyz 缩放后重渲的,与未缩放的 annot 代码几何对不上, 拿去做"多视角增强"就是全量图-标签错配。论文那句 "each matched with five CAD rendered images" 说的不是 5 个可用视角。HF 卡和论文都不写这一条,最容易踩。

输出契约:最终实体必须赋给变量 solid

annot 里的 CadQuery 代码统一把最终实体赋给名为 solid 的变量 —— 官方评测脚本直接往生成 代码后面拼 cq.exporters.export(solid, ...) 导 STEP。做 SFT 或自建 eval 时若不保留这个约定, 代码能跑通但导不出几何(会被官方 IoU 流程静默踢出分母)。

⚠ 许可:未声明

HF 数据集页的 cardData.license 返回 None,tags 里没有任何 license: 标签 → 数据集本身没给许可证。 上游血缘(ABC → DeepCAD → GenCAD-Code)不构成授权:那些仓的 MIT 只覆盖代码不覆盖数据, 且几何继承 Onshape ToUrepo license ≠ data license。 本库按团队要求"先传上来并在 README 标注"处理,再分发授权状态未解决

Schema

query(源库自带的 prompt;固定 106 字符指令模板、逐行相同,本次实测与模板不一致(含缺失) 0 行,缺失行回填同一模板) · image已内嵌,实测 PNG 163,671 行) · annot(CadQuery 代码,ground truth) · reasoning(null) · cate=E / task=T-E1(⚠ 占位符 —— 图像→代码生成在正式任务表里没有干净对应, T-B4 是几何理解,不是这个;没猜,待组会定;脚本内注释与此同口径) · metadatadeepcad_idsplitimage_pathimage_formattoken_counthundred_subsetsource_prompt

metadata.token_count 不是代码长度:官方转换脚本里它 = 代码 token + 图像 577 + prompt 69, 想按代码长度筛必须先减 646(论文说的平均 611 token/脚本是纯代码口径)。而且上游只为 train/test 生成了 token 计数,validation 整列是 null(核查员抽 4 个 offset × 100 行 nonnull=0;本次转换实测各 split 非空行数:train 147,289/147,289, validation 0/8,204, test 7,355/7,355, none 0/823)—— 任何 token_count <= N 之类的过滤 都会把整个 validation split 静默清零。本库不做任何过滤、原样带出。

metadata.deepcad_id 可与 AI4Manufacturing/deepcad 对齐(同一 DeepCAD 编号体系)。

Load

from datasets import load_dataset
ds = load_dataset("AI4Manufacturing/gencad_code")

Gated — request access; granted manually.

Provenance

Downloads last month
13

Paper for AI4Manufacturing/gencad_code