狠狠干狠狠操-久青草视频-天堂网站-欧美日韩亚洲综合-黄色三级av-成人欧美在线-综合久久av-欧美人与禽zozzozzo-国产黄色高清视频-97影音-亚洲视频图片小说-国产 欧美 自拍-毛片的网站-天天干人人-欧美黄色免费在线观看-亚洲香蕉中文网-99热这里只有精品5-这里只有精品免费视频-看国产一级片-中国女人av

你的位置:首頁 > 互連技術 > 正文

Imagination E 系列 GPU 斬獲架構創新獎 融合算力架構破解物理 AI 系統設計難題

發布時間:2026-08-24 來源:轉載 責任編輯:lijiahuan

【導讀】8 月 20 日,第六屆集成電路設計創新會議暨應用展(ICDIA 2026)在南京順利舉辦,Imagination E 系列 GPU IP 憑借領先的端側 AI 與圖形融合架構創新,成功入選 “2026 強芯 TOP100” 并斬獲架構創新獎。同期的具身智能生態論壇上,Imagination 進一步分享了面向機器人領域的 GPU 融合計算加速方案。針對當前物理 AI、具身智能設備普遍存在的算法迭代快、數據搬運功耗高、算力調度沖突、硬件空間散熱受限等行業難題,Imagination 創新性提出 GPU 融合可編程 AI 架構,打破傳統 GPU、NPU 獨立異構的設計模式,以統一可編程算力底座,適配新一代機器人、自動駕駛等端側智能系統的長期迭代需求。


圖片29.png


在同期舉辦的具身智能生態論壇上,Imagination技術經理孫千喆以《面向機器人領域的GPU融合計算與加速解決方案》為題發表演講,指出隨著機器人等物理AI系統的自主化程度不斷提高,提供支撐的相關端側芯片的計算架構已超越傳統GPU或專用AI加速器的范疇,需要在一顆晶粒(die)上用一個可編程單元來將感知、世界模型、推理和圖形處理融合(converge)在一起,以幫助系統用戶打破在新一代系統中遇到的計算和物理制約因素。


圖片30.png


一場獎項認可,一場技術演講,看似各有側重,實則指向同一個正在浮出水面的產業判斷:物理AI和一部分端側AI正在推動新一代計算架構走出“專用加速器”的舒適區,轉而要求一個能夠同時承載場景信息處理、圖形處理、AI計算與智能的融合算力單元,Imagination的E系列GPU是業界首個采用此類架構并可編程的融合處理器,此次獲獎與被討論也使其成為這一趨勢的縮影:其“GPU融合可編程AI架構,面向未來系統設計”的產品定位,回應的恰恰是當下物理AI系統設計面臨的結構性挑戰。


物理AI系統設計的三重矛盾


機器人這樣的物理AI系統的工作負載正以令硬件設計者焦慮的速度演進。從感知、世界建模、推理、人機交互到生成式AI應用,幾乎每年都會涌現出新的算法。與之相對,專用加速器的性能增長往往依賴一條固定流水線,以兌現單一代際的性能承諾,這導致了軟件棧日趨割裂,使研發工程師不得不隨加速器的每次換代重寫算子,系統架構的擴展性被一次次透支。


圖片31.png


具身智能正在引起廣泛的關注和參與,圖為人頭攢動的“2026世界機器人大會”(圖片來源:華興萬邦)


比算法迭代更隱蔽的成本,藏在數據搬運里。在典型的異構SoC中,CPU、GPU、NPU與編解碼器各自掛載獨立的SRAM(靜態隨機存取存儲器),每一次數據交換都要跨越內存邊界,而跨內存邊界移動數據的能耗,據估算可達計算本身的數十倍,延遲與抖動也隨之累積。與此同時,功能安全要求關鍵路徑獲得隔離,能效優化又要求算力共享,混合關鍵性帶來的矛盾讓單一固定架構難以兩全。


算法演進與固定流水線的矛盾、數據搬運的隱性能耗、安全隔離與算力共享的沖突——這三重矛盾共同構成了端側系統設計的基本約束,再加上機器人這樣的物理AI許多工作負載都并發進行使情況更加令人焦慮。同時,阻礙物理AI前進的因素還有物理和化學問題,電池容量并不能快速提升,而且在機器人十分寶貴的腔體空間,不能無限制添加硬件,還會遇到散熱問題。也正因為如此,如何以一套架構用GPU融合計算與AI,不再是一個可選項,而是下一代系統設計繞不開的命題。


Neural Cores與Burst Processors:可編程底座上的兩項創新


Imagination的E系列GPU IP專為端側AI與圖形系統而設計,依托高效的并行處理架構,在實現卓越圖形性能的同時,可支持從2 TOPS(每秒萬億次運算)到200 TOPS的INT8 AI工作負載,覆蓋圖形渲染、桌面應用、智能手機自然語言處理、工業視覺以及自動駕駛等場景。因此,E系列GPU是開發用于機器人和自動駕駛汽車等物理AI應用的絕佳底層IP產品。


圖片32.png


支撐E系列特有的GPU融合AI加速器架構創新是兩項深度集成于GPU中的創新。Neural Cores(神經核)作為GPU內置的AI加速單元,最高可擴展至200 TOPS(INT8),在顯著提升AI與計算性能的同時,與GPU及異構計算的軟件生態體系全面融合;GPU中集成的Burst Processors(爆發處理器)則通過架構層面的設計,使邊緣應用的平均功耗效率提升25%,在不犧牲性能的前提下,為端側設備爭取到更長的續航與更充裕的散熱余量。


而貫穿這兩項創新的共同底座是可編程性。GPU作為可編程處理器,能夠有效應對圖形、計算與AI算法的不斷演進;開發者既可以通過Vulkan、OpenCL等主流API直接解鎖AI能力,也可以借助基于開放標準的軟件棧,將現有代碼輕松遷移至神經核。Imagination提供的高效計算庫與圖編譯器進一步釋放GPU潛能,使每一次算法迭代都不必等待新的硬件流片。


AI進入計算路徑:融合架構如何省掉每一次內存往返


如果說可編程性是E系列的方向,融合計算就是它的實現路徑。這一架構由四個要素共同支撐:共享內存層級,以一套SRAM/緩存結構同時服務感知、推理、世界建模與圖形;共享調度器,在SIMT(單指令多線程)管理下對計算、矩陣乘、采樣器與DMA流水線進行在線細粒度調度。共享編程模型,則以OpenCL、PyTorch、llama.cpp、ONNX、Vulkan等一套工具鏈打通各計算平面;靈活架構,以統一的ISA、DDK與產品家族,從單瓦級設備覆蓋到多芯粒系統。


圖片33.png


這一思路與傳統“外掛式”(Bolt-on)NPU模式形成鮮明對照。在Bolt-on模式下,NPU與GPU各自持有獨立的存儲與流水線,每層推理都要發生內存往返,不支持的算子還需回退到CPU;而E系列將矩陣乘加速器(MMA)直接集成進統一著色簇(USC),與其余計算共享內存、調度與編程模型,中間結果留在片上,數據搬運與調度抖動同步下降。


在更細的執行粒度上,tile-local SRAM實現局部執行,微分塊(micro-tiling)讓層間折疊為單一內核,imgGC圖編譯器把相鄰算子融合進同一個著色器,PVRIC無損幀緩沖壓縮與ASTC/HDR紋理壓縮進一步削減帶寬需求。


如果說共享內存與調度解決的是數據“搬不搬”的問題,數據通路的設計則回答了數據“怎么算”的問題。FP32、FP16/BF16、FP8、INT8與MXFP4共享同一條數據通路,吞吐最高可達FP32的16倍,精度格式混用不產生額外的格式轉換開銷——感知骨干網絡、世界模型、VLA(視覺—語言—動作)策略與量化CNN各取所需,系統設計不必為單一精度提前站隊。


同一套可編程架構,覆蓋從機器人到汽車的算力曲線


當前,機器人正在走下舞臺,走進生產和生活。對機器人與具身智能而言,融合架構的收益最為直觀。一顆芯片需要同時承載四個計算平面:負責傳感器接入與融合、計算機視覺與DNN推理的感知平面,負責SLAM(同步定位與建圖)、VLA與場景推理的世界模型平面,負責渲染、手勢識別與遙操作的HMI平面,以及負責實時驅動與監督的控制安全平面。確定性控制環與感知—行動環兩條閉環在同一芯片上并存,恰好是共享調度與共享內存所擅長的場景。


圖片34.png


然而,對機器人廠商而言,融合架構的價值不止于把四個計算平面塞進一顆芯片,更在于它能否跨越從原型到量產的那道坎。原型到量產之間,橫亙著一道“硅缺口”。實驗室里用基于通用GPU的開發模塊驗證算法是正確路徑,但量產機器人必須裝進密封殼體、靠電池供電、把BOM壓到消費或工業級可接受的范圍,還要支撐長達十年的軟件迭代與升級。


出貨只有50臺時,開發模塊的成本微不足道;出貨5萬臺時,它就成了整機BOM清單上的絕對主角,這推動市場競爭變成誰先把成本降到比基于通用GPU開發模塊遠遠更低的程度。于是問題變成了:量產需要一顆真正的芯片,而這顆芯片一旦流片就固定了,因此,如果它是專用NPU或者其他加速器,算法每演進一代就可能需要重新流片,其巨大的經濟性挑戰已經在智能駕駛芯片企業難以盈利中得到了體現。


如果它是通用GPU,雖然可以通過軟件實現更新,但是復雜系統和應用顯然還需要(外掛)AI加速器,從而帶來了物理AI的空間、功耗和電池續航等物理化學問題。


如果它是Imagination E系列這樣GPU融合可編程AI加速器,不僅新算法通過軟件更新即可落地,同時還能提供可根據需求設定的AI加速器,用同一顆硅片能撐過整個產品生命周期。


圖片35.png


當機器人要走下舞臺時,對于物理AI,除了解決算力問題,還需要解決一系列物理(和化學)問題(圖片來源:華興萬邦拍攝于WRC2026)


安全能力也為這條算力曲線提供了縱深。Imagination GPU 所承載的分布式安全機制(DSM),包括ECC(糾錯碼)與Parity奇偶校驗、CRC(循環冗余校驗)、Safety Pairs安全對、雙核鎖步固件、調度器聯鎖與Tile區域保護,以不翻倍芯片面積為代價實現持續故障覆蓋,支持ISO 26262(汽車功能安全標準ASIL-B, ASIL-D)安全標準,并已在車規場景完成驗證,可以快速移植到機器人和其他物理AI領域。


面向消費與桌面市場,Imagination E系列硬件級虛擬化支持每核最多16個虛擬機或者操作系統且內存完全隔離,多核去中心化擴展與固件管理調度則讓同一架構平滑覆蓋AI PC與桌面計算。作為規模化驗證,基于Imagination GPU架構的設備全球累計出貨已達110億臺。


架構是曲線,芯片是曲線上的點


一顆芯片只是曲線上的一個點,一個架構才是曲線本身——這是Imagination反復強調的判斷,也是理解其E系列GPU的正確坐標。從單瓦級延伸到多芯粒,從機器人延伸到汽車,Imagination E系列GPU以同一套標準軟件棧與工具鏈,把圖形、計算與AI收斂到同一個可編程平臺之上。


回到ICDIA的獎項與具身智能論壇的演講,它們之所以值得被放在一起討論,是因為二者共同確認了一件事:在端側AI與圖形、計算、感知和AI加速持續融合的趨勢下,能夠跟上長周期算法演進的架構,同時又能更好地適配物理AI的各種物理化學約束,而不是某一款固定功能的加速器,不是純粹的通用GPU,而是一種GPU融合可編程加速的算力底座。


Imagination E系列GPU以“GPU融合可編程AI架構”回應“面向未來物理AI系統設計”,不綁定單一工作負載,讓系統設計有能力跟上算法的下一次演進,也讓芯片設計公司開發的物理AI SoC有更長的生命周期,有更多芯片出貨來攤銷研發成本并早日盈利。


結論

本次獲獎與技術分享,印證了 Imagination E 系列融合 GPU 架構,精準契合物理 AI 與具身智能產業的發展趨勢,有效解決了當前端側智能系統設計的核心痛點。傳統異構算力架構存在算法適配性差、跨單元數據搬運能耗高、安全隔離與算力共享難以兼顧等結構性矛盾,且專用加速器架構固化、迭代成本高,無法適配機器人 AI 算法快速更新的行業節奏。


gg_20260512171736_266_20260622170931_179_20260707113844_971_20260708172203_213_20260710172006_775.png

特別推薦
技術文章更多>>
技術白皮書下載更多>>
熱門搜索

關閉

?

關閉