重点推荐
题目: 融合改进YOLO与知识图谱大模型的塔机风险自动感知框架
原题: Fusing enhanced YOLO and knowledge graph-based large language models for automatic risk perception in tower crane operations
作者: Lingxiao Wang, Jingfeng Yuan, Shu Su, Hongxing Ding, Yu Bai, Miroslaw J. Skibniewski
发表日期: 2026-03
来源: Automation in Construction, Volume 183, Article 106823 (gmail)
关键字: 塔式起重机、风险感知、YOLO、知识图谱、工程大模型
研究方向: 方向3:多模态语义融合与工程知识建模
DOI: 10.1016/j.autcon.2026.106823
摘要: 施工塔机作业环境复杂且动态变化,具有固有高风险,增强操作人员的感知和认知能力对于安全保障与态势感知至关重要。本文提出集成框架,将改进的YOLOv8模型与知识图谱增强的大语言模型结合,实现主动、智能的安全管理。改进YOLOv8引入基于注意力的优化,提高塔机视角下小目标检测精度;领域安全知识图谱用于表示关键实体、关系和操作情境,并与微调后的GPT模型对齐,从而支持语义推理和情境化危险解释。集成系统把视觉感知与结构化知识推理连接起来,提供实时、可解释的安全反馈。该方法提升了塔机操作人员的感知、理解和决策能力,推动复杂施工环境的安全管理从被动监控转向主动智能控制。
总结:
过去:塔机施工环境复杂动态,传统安全监控依赖人工经验,操作人员难以实时识别小目标风险(如障碍物、人员),缺乏结构化知识支撑的语义推理能力,安全管理以被动监控为主,事故预警滞后。
现在:本文提出集成YOLOv8(注意力优化提升小目标检测)与领域安全知识图谱增强的GPT模型。视觉模块实时检测塔机视角下的小目标;知识图谱表达实体、关系与操作情境,使大语言模型能够进行语义推理并生成情境化危险解释。系统将视觉感知与结构化知识推理融合,输出实时可解释的安全反馈,显著提升操作人员的感知、理解和决策能力。
工程价值:该框架可直接部署于塔机施工现场,用于实时风险预警与安全辅助决策。操作人员通过可解释的反馈理解危险成因,减少误判;项目管理方可实现从被动响应到主动智能控制的转变,提升复杂施工环境的安全管理水平。未来可拓展至其他起重机械或大型施工设备的安全监控场景。
========================================================== ==========================================================
相关推荐
1. Alchemy:基于模型的核电系统二维到三维自主设计方法
原题: Alchemy: A model-based approach for 2D to 3D autonomous nuclear system design
作者: Harleen Kaur Sandhu、Nicholas Cole Crowder、Peter Anton Suyderhoud、Abhinav Gupta、Adam Pluth、Samantha Thueson、Drew Rizk、Maria Eduarda Montezzo Coelho
发表日期: 2026-07-15
来源: Nuclear Engineering and Design (OpenAlex)
关键字: Engineering、Systems design、Computer science、Control engineering、Systems engineering、Control system、Mechanical engineering、Nuclear power、Nuclear industry、Mockup
DOI: https://doi.org/10.1016/j.nucengdes.2026.115100
摘要: 核电站(NPP)管道与设备系统的工程设计常常跳过关键的二维系统规划,直接进入三维建模。这种做法往往导致设计超出建筑围护结构约束,迫使进行昂贵且耗时的重新设计。当采用二维建模时,将系统图转换为三维模型需要在互不兼容的专有工具之间进行劳动密集型手动流程,每一步都会引入解释错误和数据丢失。目前尚无现有框架能够直接根据二维核电系统定义,端到端自主生成符合工业基础类(IFC)标准的三维建筑信息模型(BIM)。本文提出了Alchemy——一个自主的基于模型框架,通过将四种能力集成到一个共享数据模型中填补了这一空白:(i)一个基于Web的界面,用于捕获分层核电系统拓扑、设备几何形状以及组件间连接关系;(ii)两阶段设备布局优化算法;(iii)通过确定性A*搜索和随机蚁群优化(ACO)实现的自动化管道布线方法;(iv)一个原生的IFC 4.0几何创作管道,可直接在符合标准的BIM层次结构中实例化建筑、设备和管道对象,无需专有软件或转换产物。通过一个共享数据模型集成这些能力(而非任何单独能力)是主要贡献,它从二维图到最终IFC几何体保持了系统标识的完整性,无需专有转换。在两个典型的压水堆(PWR)配置上验证,Alchemy生成了完全连接、符合IFC的三维设施模型,满足所有几何和系统约束:案例1(5个设备项,6个管道连接)耗时47秒,案例2(10个设备项,8个管道连接)约2分钟。这项工作代表了核设施初步设计数字化工程的基础性一步,未来的持续开发将针对设计规范合规性和扩展系统复杂性。
2. 基于LLM与RAG知识约束的预制桥梁BIM自动建模方法
原题: Knowledge-driven automated prefabricated bridge modeling from natural language using LLM and RAG
作者: Fei Huang, Dapeng Mei, Canwen Yang, Chuanhai Su, Runping Ma
发表日期: 2026-05-25
来源: Scientific Reports (gmail)
关键字: 预制桥梁、检索增强生成、自然语言建模、参数约束、BIM自动生成
DOI: 10.1038/s41598-026-53765-0
摘要: 在预制桥梁设计中,把非结构化自然语言需求转化为标准化BIM模型仍是重要效率瓶颈。现有BIM工具缺少自然语言与工程标准之间的知识驱动对齐,也缺少从文本指令到几何建模的端到端自动化。本文提出AutoBIM框架,融合大语言模型、检索增强生成和结构化提示,把开放域指令自动转换为完全符合规范的BIM模型。核心方法利用RAG将大模型输出约束在经过验证的标准构件知识库中,实现100%的参数准确率并确保符合工程规范。真实预制箱梁桥实验显示,AutoBIM对多种指令取得100%的任务成功率,约3.5分钟即可完成建模,显著优于纯大模型和关键词方法。结果证明,LLM与RAG融合能够支持语义驱动的标准化工程设计,为智能BIM建模提供知识驱动路径。
3. 基于深度学习的二维工程图纸自动转换为三维实体模型
原题: Deep Learning-Based Automation for Converting 2D Engineering Drawings into 3D Solid Models
作者: Wen‐Ren Jong、Yi-Hsin Lin、Yi-Hsin Lin、Yu-Chun Lin、Yu-Chun Lin
发表日期: 2026-07-12
来源: Machines (OpenAlex)
关键字: Engineering drawing、Computer science、CAD、Dimension (graph theory)、Process (computing)、Automation、Feature (linguistics)、Artificial intelligence、Solid modeling、Computer Aided Design
DOI: https://doi.org/10.3390/machines14070781
摘要: 工程图纸是产品研发过程中最关键的参考资料之一。随着计算机硬件和软件的快速发展,工程图纸的呈现方式已从传统的手工绘图演变为计算机辅助设计(CAD)。然而,目前将二维图纸转换为三维模型仍需要在CAD软件中进行手动操作。这一过程耗时、费力,且若工程师误读图纸容易出错,导致模型缺陷。为解决此问题,本研究采用Darknet SDK训练YOLO模型,以二维工程图纸作为训练数据。通过对图纸特征进行图像分割和分类,训练了七个特定特征的YOLO模型,用于检测:正投影视图(100%)、几何特征(100%)、凸凹特征(99.9%)、尺寸组(99.8%)、尺寸线(99.1%)、理论尺寸(98.6%)和文本字符(93.6%)。这些预训练模型随后用于从二维图纸中提取尺寸和几何信息。相应的尺寸值与图像中检测对象的相对尺寸和边缘长度进行匹配,并存储在关系数据库中。随后,集成Siemens NX CAD软件及其NX Open二次开发模块,将识别出的二维图纸特征转换为三维模型。该方法减少了二维到三维模型转换中的尺寸误差,确保了特征识别的准确性,并提高了模型生成的效率。
4. 面向BIM信息检索的低成本多智能体代码生成系统ARCBIM
原题: Cost-effective and minimal-intervention BIM information retrieval via condensed multi-LLM agent code generation
作者: Pei Troh Koh, Huiyuan Xue, Jun Ma, Jack Chin Pang Cheng
发表日期: 2026-01
来源: Automation in Construction, Volume 181 Part A, Article 106585 (gmail)
关键字: BIM信息检索、多智能体、Revit API、代码生成、工程智能助手
DOI: 10.1016/j.autcon.2025.106585
摘要: AEC行业越来越依赖BIM管理复杂数据,但人工信息检索仍然低效且普遍存在。已有自动方法主要面向IFC格式并依赖模板,对大语言模型跨不同领域专用语言和代码库生成检索代码的能力探索不足。本文提出面向BIM的对齐—精炼代码生成系统ARCBIM,包括负责函数对齐的前缀模块、负责代码精炼的后缀模块,以及提高成本效益的压缩智能体设计。针对Revit C# API的80个不同查询开展评估后,ARCBIM把每条查询的平均错误数从独立智能体基线的5.75降至1.26;80%的生成代码可在三次本地精炼内达到可用状态。该系统以有限人工干预支持不同复杂度的灵活BIM数据检索,为以用户为中心的自动检索提供了解决方案。
5. Ortho2CAD:基于视觉语言模型的正交投影图生成3D CAD模型
原题: Ortho2CAD: 3D CAD generation from orthographic drawings using vision language models
作者: Aditya Joglekar、Amit Regmi、Kenji Shimada、Levent Burak Kara
发表日期: 2026-07-09
来源: arXiv (Cornell University) (OpenAlex)
关键字: Orthographic projection、Computer science、CAD、Workflow、Key (lock)、Artificial intelligence、Generator (circuit theory)、Natural language processing、Engineering drawing、Language model
摘要: 工程设计意图通常通过光栅化的正交投影图来传达。然而,下游工作流 inherently 需要可编辑且参数化定义的三维计算机辅助设计(CAD)模型。为弥合这一差距,我们提出了 Ortho2CAD,这是一种专门设计用于将光栅化正交投影图直接转换为可编辑的 CadQuery 代码的视觉语言模型(VLM),该代码随后可无缝转换为 3D CAD 模型。为有效训练模型,我们在已有显式 CadQuery 代码标签的情况下使用监督微调(SFT),并在缺少真实标签的场景中应用基于几何的强化学习(RL)来优化模型。为实现规模化学习,我们创建了一个基于 pythonOCC 的绘图生成器,可从 STEP 模型渲染第一角投影图,包含虚线隐藏线和关键尺寸。在包含有/无 CadQuery 监督的现有数据集上,我们生成正交投影图,并证明我们的模型能够生成 100% 语法有效的代码。此外,它实现了超越所有基线的 3D CAD 交并比(IoU)精度,与次优模型相比平均相对提升超过 7%。我们证明,结合 SFT 和 RL 技术的 VLM 可以有效推进从正交投影图到 3D CAD 重建的发展。我们的实现可在 https://github.com/AdityaJoglekar/Ortho2CAD 获取。

发表评论 取消回复