openBIM Talk | 让数据真正服务模型:交通基建高质量数据集建设
高质量数据集不是企业数据的简单汇总,而是能够被模型直接消费、经由质量控制并持续提升模型能力的数据产品。本文以交通基建实践说明从数据治理到model-ready、agent-ready的建设路径。
- 作者:
- 王晶
- 来源:
- buildingSMART中国

整理说明:本文根据2026年8月openBIM Talk第二期《交通基建行业高质量数据集建设实践》整理。
高质量数据集的关键在于“模型可用”
交通基础设施的设计、施工、养护和运营业务正在形成高质量数据集建设场景。高质量数据集应放在“人工智能加”与行业智能化的背景下理解:它不应只是被存储、被统计或被展示的数据集合,而应当能够直接服务模型训练、评估和应用迭代。
定义强调,高质量数据集是经采集、加工等处理后,可直接用于开发和训练人工智能模型,并能够有效提升模型性能的数据集合。这里有两个不可分割的条件:一是数据处理本身达到要求,二是数据能够被特定模型和任务消费,并在可测量的意义上带来性能改进。

技术要点: 数据是否“高质量”,不由存储规模或展示价值决定,而由它能否被目标模型直接消费、能否支撑明确任务、能否经评测证明有效决定。
四个质量维度:多样性、完整性、准确性与适配性
实践中的质量要求可归纳为四个维度:样本多样性、规模完整性、标注准确性和模型适配性。这四项并非独立的验收清单,而是一条从现实场景到模型效果的因果链。
-
样本多样性要求数据覆盖真实业务会遇到的环境、对象、工况和异常情况。以路面表观病害检测为例:在某一地区的干燥地貌中采集、标注并训练出的模型,未必能适用于植被、落叶和光照条件显著不同的地区。若训练样本只覆盖局部工况,模型在本地表现良好并不能说明它已经具备可推广性。
-
规模完整性也不只是“样本越多越好”。对于目标检测、三维构件识别、地质预报或问答任务,数据量需要覆盖任务所需的类别、层级、输入形态和边界条件;缺失关键类别、少见工况或负样本,会让模型在真正需要判断时失去参照。
-
标注准确性是另一个容易被低估的约束。ImageNet的后续分析表明,大规模众包标注并不会自动保证准确性。标注一旦存在系统性误差,模型会把错误当作学习信号。数据集建设因此需要把标注规范、人员能力、抽检、复核、冲突处理和反馈闭环作为工程,而不是将标注视为一次性劳务。
-
模型适配性则把前面三项落实到训练过程。数据的字段、格式、样本组织、标签设计和切分方式应与模型任务一致,使模型能够加载数据、得到有效梯度信号,并在预定义评测中呈现改善。若一个数据集只能供人浏览或制作统计报表,却不能进入训练、微调、检索、推理或评测链路,它仍不是面向AI的高质量数据集。
技术要点: 数据要素主要服务人的判断和经营管理;高质量训练数据主要服务模型的学习、评测和行动。两者可以共享来源,但不能混用验收标准。
数据集要覆盖预训练、监督和评测三类用途
大模型研发所需数据大致可分为三类。第一类是预训练语料,通常来自自由文本、文档或多模态材料,经清洗、去重和处理后支持自监督学习。第二类是监督数据,例如问答对、推理轨迹、任务指令和结构化标注,用于微调和定向能力塑造。第三类是评测数据,用于训练后检验准确性、任务表现及相关安全或价值对齐要求。
这一区分有助于避免一个常见误解:把所有材料都转成“问答对”,并不等于完成数据集建设。不同阶段需要的数据粒度、质量规则、泄漏控制、样本切分和评价方法不同。预训练数据关注覆盖与清洗,监督数据关注任务定义与答案质量,评测数据则要特别避免与训练集污染,并保留对真实使用场景的代表性。
中交集团围绕应用领航、数据带动、模型应用跃升和生态引领等任务梳理场景需求。经过多轮合并、筛选和聚焦,形成由不同业务单位牵头推进的高价值应用场景。这里的顺序值得注意:先界定场景和任务,再组织数据与工具,而不是先建一个抽象的大平台,再等待业务自发填充。

技术要点: 高质量数据集不是无根的数据工程。它必须从可验证的业务场景和模型任务反向定义数据对象、标注规则、评价指标和迭代闭环。
从数据治理基础走向model-ready
既有的数据湖和企业数据治理为后续加工提供了基础,但这些数据并不天然就是AI训练数据。它们包括企业运营数据、非结构化材料和面向勘察、设计、施工、运营的业务信息;进入模型链路后,仍需按任务完成解析、清洗、结构化、标注、合成、质检和版本管理。

数据集平台覆盖采集、存储、预处理、标注、合成、质量检查、模型训练、验证、迭代和运营等环节,并针对三维模型、图像、图纸等材料配置专门处理能力。它的目标是使数据达到“model-ready”,即能够被模型直接用于训练或验证。

阶段性建设目标包括预训练语料、交通基础设施领域问答对、图文点云等多模态对齐数据。早期已形成400亿token预训练语料、60万对行业问答与长推理数据、5.9万对点云三模态对齐数据。数字本身应当连同其统计口径、许可范围、去重策略、数据切分和评测方式一起理解;它们说明的是建设规模,而不是单独足以证明质量的结论。

从model-ready进一步到agent-ready
建设目标正在从model-ready扩展到agent-ready。前者关注数据能否训练模型和改善参数;后者关注数据能否被智能体检索、调用、组合并嵌入企业运行过程。
这一扩展与本体、关系、动作、知识图谱、向量知识库和自由文本结构化表达联系起来。智能体需要的不只是能读的文档,还需要知道对象是什么、对象之间有什么关系、可以采取什么动作、何时调用哪个工具,以及行动结果如何回写到业务过程。这里与前一位报告中讨论的语义和知识系统形成呼应:数据集要服务的不只是模型输出,还包括受约束的任务执行。
技术要点: model-ready解决“数据能否训练模型”,agent-ready进一步解决“数据能否支撑对象识别、关系理解、工具调用和业务行动”。
平台能力可概括为智能清洗、仿真合成、人机协同标注、跨模态对齐以及与相关数据基础设施的衔接。平台并不是质量的替代物;平台的作用是将质量规则固化为可重复执行、可审计、可迭代的流程。
BIM构件数据集:从“构件库审核”反推三维多模态学习
第一个案例来自BIM构件库。构件库需要支持构件上传、下载和复用,但运营方在大规模审核中可能遇到“描述与实际构件不一致”的问题,例如上传物件的类别、缩略图、名称和技术描述之间不匹配。若完全依赖人工审查,面对大量构件和多业务单元时,审核成本会迅速上升。

技术路线不是直接把IFC文件原样交给语言模型,而是将BIM模型转换为点云或网格,通过引擎生成多视角图像,并结合参数与文本描述生成问答样本。这样形成的三维多模态数据集包含点云、多视角图像、文本描述、单轮和多轮问答等内容,可同时服务审核、构件理解和三维问答任务。


该数据集称为trip3DMM,并与其他三维数据集作对比。其定位是面向交通基础设施构件,而非仅覆盖室内或游戏场景。数据集按BIM相关的分类分项组织标签,并持续补充规模与类别。

在审核任务中,图文对齐可用于对缩略图或截图与文本描述的一致性进行判断,以发现“货不对版”的构件。在所述数据、模型和评价设置下,该任务的准确率达到99.76%;点云问答模型在问答与分类下游任务中取得21%的提升。这些数字不能直接外推到其他构件库或其他模型,不能直接外推到其他构件库或其他模型。

技术要点: 三维构件数据集的价值不在于把模型截图做成图片库,而在于将几何、视图、参数、描述和问答组织成可相互校验的多模态样本,使“构件是什么”成为可训练、可审查的问题。
还包括从文本和图像生成点云的探索,以及数据集在标准贯彻、验证工具和相关成果中的应用。这说明数据集建设与模型研发、业务审核、标准化和评价工具可以形成互相校正的闭环:任务暴露数据缺口,数据集支撑模型,模型在业务中接受验证,验证结果再反向改进质量规则。

数据集建设最终是一项工程能力
主线十分明确:高质量数据集必须从真实场景出发,经由明确的质量维度和平台流程,形成模型可用的数据产品;当目标进入智能体阶段,数据还要具备对象、关系、动作和工具使用所需的组织能力。
对基础设施行业而言,数据集建设不能等同于资料汇集,也不能只由算法团队单独完成。它需要业务专家定义任务边界,数据团队保证采集和质量,模型团队验证适配性,标准化团队沉淀可共享规则,应用团队在真实场景中检验结果。只有这条链条闭合,数据才会从“沉淀的资产”变成能够提升工程认知和行动质量的基础设施。
作者简介

王晶,中国交通信息科技集团有限公司中交 AI 中心首席科学家。
