“buildingSMART国际—亚洲2024峰会”摘选:知识图谱技术
Emma Hooper
- 作者:
- bSC课堂
作者:bSC课堂
Emma Hooper
Emma Hooper是英国权威数据处理公司信息管理部总经理,也是ISO 19650、英国BIM导则的编制人。她在本次峰会上阐述了“知识图谱技术对于提升基于 BIM 的信息管理”的重要性。以下是她的发言记录(有删节和调整)。
在当今快速发展的建筑行业,数字化的焦点比以往任何时候都更加重要。然而,尽管我们取得了进展,我们离充分实现其潜力仍有很长的路要走。目前行业最大的不足之一是在 信息管理和理解方面。希望我们能将注意力从3D模型和那些承诺解决所有问题的软件中转移开。让我们集中精力于核心概念: 信息。
信息,和它所代表的物理资产一样, 本身就是一种资产。它构成了数字化的基础,但多年来,我们忽视了它应有的关注。这种忽视导致了我们行业目前所经历的混乱。那么,我们应该如何管理信息呢?我提出一个“两层的管理方法”。
首先,是基于活动的管理层,包含项目各个阶段的循环活动。其次,是信息层,涵盖了信息如何连接、排序及其含义的所有规则。信息层至关重要,因为信息在整个资产生命周期中不断交换。本次演讲将聚焦信息层,因为它对我们所做的一切都至关重要,也是 buildingSMART International (bSI)发挥重要作用的地方。
在信息层中,理解标准化的必要性至关重要。自从 CAD 软件引入以来,专有的结构规则和语义被用来定义资产信息。这在信息处于软件环境中时效果很好,因为这些信息是为特定环境创建的。然而,一旦信息脱离该软件环境,信息就难以在无法共享的情况下继续存在。你无法用这些信息做任何事情。
软件应用程序是 处理/生产信息 的工具;它们不应被用来 定义信息。信息的结构应该在软件之外定义,考虑到更广泛的信息管理场景。这种定义应该是中立的、开放的、负责任的,并具有长久性。因此, 信息必须独立于软件应用程序进行定义。
我们要摆脱必须在每个系统之间转换和翻译点对点数据的场景。为实现这一目标,我们需要一个跨越整个资产生命周期的基础信息层,包含通用的结构、规则和语言,以便共享信息。这一切需要标准化。
标准化是解开混乱的关键。信息本质上是复杂的——它是结构化的、非结构化的、多方面的、分层的,并以多种方式连接。其视图根据用途而变化。标准化对于提高这种“复杂性”的互操作性至关重要。为了有效连接一切,我们必须考虑数据模型的方案。有几个标准占据了信息层的中心位置,ISO 16739(IFC)就是其中之一,作为规范数据模型的方案。
数据模型规定了事物如何排序及其相互关系;它们本质上是关于“关系”的。为了使信息管理有效运作,并理解它可以发挥的重要作用,这两个层次—— 管理层和信息层——需要连接起来。我目前正在把信息管理定义为一个从数据驱动角度看待的连接系统,并以此确定所有相关标准的位置。
我通过讲 ISO 19650 作为基本框架来简化这一点。所有工作都从企业组织、资产和项目层面的用例(use case)开始。从这些目的出发,通过流程映射和建模,可以定义更具体的需求。其结果是 信息需求(information requirements,IR),这些需求随后需要在数据库中进行合理化和结构化。
在更详细的层面上,标准化的信息需求被放入一个主数据库中,该数据库可以跨越整个资产组合。这个数据库按照信息需求的层级、分类和数据需求进行结构化。然后,这一源头的需求将根据 触发事件(trigger event)和里程碑(milestone) 进行过滤。
在合约层面,交换信息需求集(exchange information requirements,EIR)被选择用于每个约定(appointment),这些约定的部分可以使用 buildingSMART 的 IDS 交换。在约定之后,这些信息需求与主要任命方的信息需求合并,形成一个整体。这又被过滤为供应链招标的交换信息需求。
被委托方通过任务信息交付计划(task information delivery plan,TIDP)响应,这些任务信息交付计划与信息需求的数据结构一起,形成主信息交付计划(master information delivery plan,MIDP)数据库的基础,并与其他计划链接。经过合理化后,任务信息交付计划被筛选输出,使BIM的被委托方聚焦于交付物作为响应。这些交付的信息模型与其他信息模型一起整合成一个项目信息模型, 该模型与主信息交付计划实时链接,以检查交付内容是否与计划一致。 一旦检查完毕,所需的信息将返回到合约层面。这些信息被用于可视化、报告,或链接到其他正在使用的资产管理应用程序。当另一个触发事件发生时,获取资产信息模型和信息需求的相关部分会重新启动这个过程。在资产生命周期中,这个循环不断发生。把这一切放在一起时,有一个贯穿始终的数据主线,我称之为“唯一的信息源”(golden thread)。
如果我们将管理层和信息层结合起来,所有管理活动的目的是为了在资产生命周期内启用连接的数据或信息模型的规划、创建、更新和维护,使用如 IFC 等标准化方案。然而,这正是我们经常出错的地方。 我们需要改变观念,因为目前,我们交付的并不是链接的——它是分散的图纸、文件、电子表格、3D 模型和不相关数据的集合。信息模型则不同,它是这些实体和关系的链接,关联数据、几何、文档和数据库。你可以选择某个元素,查看是谁创建的、何时创建的以及它链接到什么。这是 IFC 能够实现的潜力。IFC 有潜力为信息模型提供基础的标准化结构,涵盖前面提到的所有资产信息模型。为了实现这一点,我们必须从基于文件的工作方式转向数据交换。这是 CDE(common data environment,通用数据环境)的核心,而不是像我们现在这样将 CDE 用作文档管理系统。 我们需要开始将数据从文件中释放出来,直接放入 CDE 数据库中,在那里我们可以与任何其他文档连接,从而使我们能够数据方式共享和查询,而不是通过文件。
接着Emma谈到了图数据库。
早在2016 年,我首次接触到‘关联语义数据’和‘知识图谱’的概念。当时我不知道那是什么,但我的直觉告诉我,它将彻底改变行业的信息管理。图是由顶点和边组成的,顶点可以被视为节点或实体,而边则是关系。相对于关系数据库,图将许多想法连接成一个整体,为计算机提供了一种更快、更有用、更完整的方式来理解现实世界的关系。
有两种类型结构去创建知识图谱:传统的 RDF 图或标签属性图。它们是结构化的,与领域的交互方式不同。选择哪种方法主要取决于任务、用例和数据。我不打算参与个场争论,但我认为,在buildingSMART 内部,我们需要更多地讨论它,但我会说, 图结构与领域知识的结合(以本体论的形式)是我们需要达到的地方,因为这正是神奇之处。
那么,知识图谱如何应用于我之前提到的内容呢?可以肯定的是,项目和资产信息模型将会走向这一方向。物理设施将在虚拟世界中由知识图谱表示。然后,组织将能够将这些数据与资产、部门和其他行业的其他数据源(如地理信息系统、财务、社会和经济数据)连接起来。
如果我们认为我们离这一目标还很远,那我们错了。因为 IFC 可以表示为一个图。 最近的一项研究探讨了“基于 IFC-Graph的建筑领域知识查询”(Junxiang Zhu etal,2024,Cypher4BIM: Releasing the Power of Graph forBuilding Knowledge Discovery)。在这个例子中, IFC 已被转换为一个标签属性图。越来越多的研究与此相关,并且这些研究成果已逐渐发表。我认为 IFC 是提供这种领域知识的起点,我真的希望 IFC5 能够考虑到这一点。IFC4 的部分以前已被转换为 RDF,我在这里进行了可视化展示。
主流技术也开始采用这种思维方式。我怀疑几年后,这将成为常态。还有另一个原因, 为什么知识图谱比以往更重要。那就是生成式 AI。 对我来说,大型语言模型非常了不起,但也很低效。我们需要更多地考虑优化和减少计算量。
当我听说 ChatGPT 时,我立刻想到知识图谱。事实上,我问 ChatGPT的第一个问题是“你在使用知识图谱吗?”结果他实际上对我撒了谎,我觉得这很讽刺。但其他人也看到了这种联系。已经有研究在探索知识图谱如何通过像检索增强生成(retrieval augmented generation,RAG)这样的技术来提高大型语言模型的准确性。 我想看到更多的讨论,讨论 IFC 如何可能适应这一切,因为我的问题是,这些大型语言模型的训练数据来自哪里?它包含了什么?
大型语言模型需要在中立、可访问的高质量数据上进行训练,这就是为什么我看到 buildingSMART 能够做出贡献的原因。我看到生成式 AI 能够帮助我们构建信息层,同时利用它来回答问题。
所以总结一下, IFC 是信息模型,它是知识图谱的基础,并为大语言模型提供基础。但这一切都始于此。IFC是构建环境的数据模型,是独立于软件的标准化模型。用户可以自由选择他们希望使用的任何工具,数据可以在任一方向上自由流动,无障碍。这个模型必须由 不与任何技术产品相关联的非营利组织管理,并且可以通过国际标准进行管理。这确保了它是可访问的,并且由行业负责。因此,行业掌握着自己的命运, 因为当我们越来越依赖数据时,这一基础模型对一切都至关重要。这就是为什么像 buildingSMART 这样的组织现在和未来如此重要的原因。
