AI 視覺方案構建了面向制造、能源電力、采掘等各垂直行業,以基礎硬件設備、軟件系統平臺、解決方案三大層級為核心,生態協同為保障的技術架構。
1.AI 視覺方案技術架構
基礎硬件設備
基礎硬件設備是 AI 視覺技術體系中實現圖像采集、數據運算和執行控制的底座支撐。主要包括工業相機與照明設備,工控機、自動執行機構、AI 訓練推理模塊與 AI 加速模塊等,為實現AI 視覺模型的開發部署提供產品成像、采集控制與算力支持。 產品成像是指在產線工位上進行工業品圖像采集的過程。該過程主要由工業攝像頭與照明設備組成成像系統,對工業品進行圖像采集,并將獲取到的視頻圖像信號傳送到圖像采集卡上,由控制圖像采集卡完成圖像采集全過程。 采集控制是指對圖像采集過程與采集設備進行有效控制。通過主控計算機和運動控制卡、圖像采集卡、I/O 接口板等,提供采集圖像處理與控制指令執行等操作,同時基于自動化執行機構,實現攝像頭三維坐標運動控制,保證攝像頭運動的準確性和快速響應性,配合機械、視覺模塊實現 X,Y 精密工作臺運動控制、Z 軸方向運動控制、方便圖像采集等。

算力支持是指對 AI 視覺質檢模型的算法訓練與邊側推理過程提供計算能力支撐。該過程主要通過 AI 訓練推理芯片、AI 加速卡、智能服務器等硬件設備,在強大的算力支持下實現AI 視覺質檢模型的高效訓練過程,同時在產線或車間等場景進行工業品質檢時,對AI 視覺質檢模型的推理過程提供邊緣算力,提高模型的實時性以滿足業務需求。
軟件系統平臺
軟硬件適配。在實際工程應用中,人工智能算法可選擇多種算法框架實現,訓練和開發人工智能模型也可有多種硬件選項,這就開發者帶來了不小的挑戰,軟硬件適配通過軟硬件的深度適配和調優,確保整個系統實現高性能的 AI 計算,支撐多場景人工智能模型的研發和應用。一是 CPU/NPU 插件,主要指將 AI 加速卡對接到計算框架和集群軟件的插件,通過將神經網絡的結構表示成計算圖,再由算子層級驅動各類計算在硬件上高效實現,對上承接各個深度學習框架訓練出來的算法模型,對下對接 GPU、NPU 等硬件后端;二是設備接入,用于將設備的數據和管理信息接入到軟件系統平臺,存量設備接入仍以邊緣協議解析為主要方式,通過不斷積累工業協議數量以提供通用化連接服務成為軟件系統平臺發展重要方式;三是集群調度,主要指將服務器、加速卡等資源納入集群統一調度管理,通過增強 AI 訓練卡等硬件物理拓撲結構的親和性調度,最大化發揮 AI 處理器計算性能,甚至在一個平臺里提供多種超強算力。
計算框架。計算框架是整個 AI 視覺技術體系的核心,實現對人工智能算法的封裝,數據的調用以及計算資源的調度使用,起到承上啟下的重要作用。按照應用場景分為云端訓練、云端推理以及端側推理三類,不同應用場景所完成的任務不同,所需承載的計算及限制條件也存在差異,因此針對各場景計算工具的功能及性能要求存在差異。云端訓練框架主要完成基于海量數據的學習模型訓練任務,對于算力要求最高,實際應用中需要采用包括分布式計算等技術保證足夠算力,同時對于工業級模型及穩定性等也有特殊要求;云端推斷框架主要完成訓練好模型的優化、云端部署及推斷功能,對于效率及并發性等具有特殊要求;終端推斷框架主要完成訓練好模型在終端的部署及計算,由于終端功耗、功能、芯片等眾多限制,對終端推斷框架的性能能耗及自身優化提出了多種限制性要求。以 TensorFlow、PyTorch 為代表的AI 框架由于開源較早,有先發優勢,生態發展有很好的基礎,而以MindSpore、PaddlePaddle等為代表的國產 AI 框架,在繼承先發框架優勢的基礎上,在科研創新與產業實踐開發中總結、創新,快速發展 AI 框架生態圈。
組件與工具。在 AI 開發部署過程中,由于硬件資源有限、易用性等問題,需要通過組件與工具提升開發效率,降低開發部署成本。一是模型開發調優,面向模型訓練、評估等過程進行優化,如可視化AI工具用于展示訓練過程、數據分布以及可拖拽式圖形編程界面等解決易用性問題;模型精度調試工具幫助算法工程師指定想要分析的信息(如梯度、權重),在訓練過程中記錄相關數據,進行異常情況自動診斷。二是算法模型部署管理,指對算法庫、服務鏡像、模型的部署和管理,如標準模型算法資源庫提供各類模型的直接調用能力,極大降低重復式開發帶來的資源浪費,同時提升開發效率;模型壓縮算法工具主要實現對于模型的壓縮和自動化調優,通過模型壓縮、加速算法組件以及超參數優化組件,使用自動化方法降低開發成本,提升模型優化易用性。三是模型運行能效管控,模型應用落地過程中,需要大量的異構算力、高速網絡與存儲等基礎架構資源的支持,同時面臨對大量不同業務應用的價值服務,需要把有限的高成本資源(CPU、GPU、內存、顯存、網絡、存儲)進行有效的監控、管理和調度,逐步實現對整個系統能力與運行效率的管理、統一分配,實現對模型主流應用框架的支持,使應用、物理資源池與邏輯資源池形成松耦合管理,靈活切換與調度。
解決方案
當前 AI 視覺解決方案面向制造業領域,主要存在三類應用。一是面向產品的質量控制與檢測;二是面向生產作業過程的作業輔助;三是面向車間、工廠和企業的設備、人員等安全隱患識別與監控。基于 AI 視覺的質量檢測。產品質量檢測主要包括尺寸測量和表面缺陷檢測,是機器視覺領域中非常重要的應用領域,應用AI+機器視覺設備獲取產品圖像,進行尺寸測量判斷或者質量缺陷的識別。隨著深度學習技術的迅速發展,依托其在大量數據中的強大學習能力和特征提取能力,能夠極大提高 AOI 檢測效果,在很多工業場景下解決以往傳統方法無法解決的難題,是當前表面質量檢測應用探索主要方向。
基于 AI 視覺的生產作業輔助。AI 視覺在生產作業環節應用的主要路徑是作為工業機器人和智能裝備的視覺感知核心,輔助進行工業視覺導航和零件的識別、分類和定位抓取。一方面,在視覺導航領域,主要面向 AGV 等輸送裝備的自動引導,相比于電磁導引、激光導引、慣性引導等方式,視覺引導具有成本低、易維護等特點,已成為升成為了目前AGV 導航算法的重要發展方向;另一方面,零件識別是工業自動化與智能化方向的重要基礎,如智能倉儲的目標識別、傳送帶零件識別分類、智能裝配零件識別等,利用深度學習增強了在非結構化特定場景中AOI對目標特征的識別能力,可以面向復雜工況的工業現場,實現大規模的零件識別分類。 基于 AI 視覺的工業現場監控。復雜的工業現場作業環境存在各種安全事故隱患,傳統基于人工巡檢的安全管控方式難以實時監控,進而容易導致不可挽回的安全事故發生。采用 AI 視覺對工業現場,包括人、設備等要素進行實時監控與安全隱患監測,能夠輔助人工提高安全管控能力,降低事故風險,典型應用包括如人員著裝規范,是否存在違規操作,是否存在侵限行為,以及如管道泄漏、明火監測等。
生態協同
行業生態建設實現全行業全流程賦能。一是開發者社區,AI與產業的深度融合不僅僅要依靠科技公司或行業企業,各類行業人才、創業團隊與創客也是創新的重要動力。二是聯盟與組織,通過聯合行業企業、信息通信業、互聯網等相關領域企事業單位、其他社團組織及高校院所,促進 AI+產業生態的不斷壯大繁榮,目前國內已經形成中國人工智能產業發展聯盟、工業互聯網產業聯盟、互聯網醫療健康產業聯盟等各類組織。三是咨詢與服務,通常由信息技術服務商、第三方科研咨詢機構,為行業發展及具體企業提供 AI 相關咨詢規劃、頂層設計等服務,從高價值企業切入,提供企業 AI 轉型升級所需的規劃設計與落地實施的全套解決方案。
2.AI 視覺方案部署
AI 視覺方案部署通常采用兩級部署方式,即產線/工廠側部署和企業數據中心部署。雖然不同工廠物理部署環境、應用需求、項目投入和網絡能力不同,但總體邏輯上保持一致。一方面是現場(邊緣)側的圖像采集、推理計算與閉環控制,滿足 AI 視覺所需的低時延和實時性要求;另一方面是云端的 AI 模型訓練、協同更新以及數據管理,滿足AI視覺模型訓練的算力需求,并且通過云邊協同,實現AI 算法模型的實時更新,高效部署云端模型至現場。采用邊緣和云端解耦部署的方式,有利于簡化現場部署架構,降低硬件成本,實現現場的標準化和靈活部署,同時又保證云端硬件及軟件能力易擴容,資源可復用,更利于工業視覺應用的廣泛推廣。
產線/工廠側部署。可根據產線實際生產質量控制流程按需部署,包括成像設備、AI 工位系統等設備。AI 工位系統僅實現圖像采集,通過工業網絡上傳圖像。一是成像設備通過工業網絡連接至AI 工位系統,以傳輸采集的待檢測對象圖像;二是 AI 工位系統連接產線PLC 等工業控制,以閉環執行控制指令;三是 AI 工位系統配置有HMI 等實現人機交互;四是 AI 工位系統通過車間網絡連接 AI 推理子系統,完成圖像數據采集及處理發送。 企業數據中心部署。可部署智能制造管理平臺相關的硬件載體,包括 AI 訓練子系統、AI 推理子系統、數據存儲和運維管理,并基于物理載體部署智能制造管理平臺。一是 AI 推理子系統接受AI 工位系統推理請求,提供推理服務;二是運維管理,能根據場景業務需求快速部署算法至 AI 推理子系統,導入到對應的 AI 質檢任務使用;三是訓練子系統,既支持在廠區本地訓練,也支持通過調用地區人工智能計算中心的訓練功能和訓練算力來進行訓練業務;四是數據存儲,提供推理結果、算法模型、原始圖片等數據管理。
該部署方案運行邏輯如下。一方面,在工廠車間產線側,AI工位系統從端側設備獲取圖像,經過圖像處理后,向AI 推理子系統發出推理請求,平臺將推理結果反饋給 AI 工位系統;AI 工位系統根據推理結果進行結果判定進行顯示或動作,AI 工位系統可實時將產線圖片及推理結果進行預處理之后,回傳至運維管理模塊并存儲到數據存儲。另一方面,在廠區機房,用戶對圖片數據進行標注,將標注好的數據集通過AI訓練子系統上的預訓練模型完成模型訓練;運維管理系統對訓練好的模型進行評估,自動發布訓練模型,并將 AI 模型部署至推理子系統。運維管理模塊持續對模型效果進行監控,用戶根據模型監控反饋的結果,判別是否需要啟動增量訓練流程;運維管理模塊根據需求,將統計數據和KPI指標推送至 MES 系統。