狠狠干狠狠操-久青草视频-天堂网站-欧美日韩亚洲综合-黄色三级av-成人欧美在线-综合久久av-欧美人与禽zozzozzo-国产黄色高清视频-97影音-亚洲视频图片小说-国产 欧美 自拍-毛片的网站-天天干人人-欧美黄色免费在线观看-亚洲香蕉中文网-99热这里只有精品5-这里只有精品免费视频-看国产一级片-中国女人av

你的位置:首頁 > 光電顯示 > 正文

英特爾:別只盯著單線程性能,智能體AI該用“實際交付量”來測

發布時間:2026-08-25 來源:轉載 責任編輯:Lily

【導讀】單線程性能、核心密度、機架吞吐量這些指標本身沒錯,但回答不了客戶真正的問題:在給定延遲、功耗和成本下,基礎設施到底能完成多少有價值的智能體工作?英特爾最近的分析給出了一個務實視角:以739個Claude Code會話為樣本的代碼智能體工作流顯示,單個請求下CPU處理時間占比不到1%,32個請求并發時升至15%——新增延遲大多來自調度排隊,而非計算。更快的核心解決不了排隊,而排隊會讓GPU跟著空轉。英特爾由此提出用“每機架實際交付的智能體數量”替代理論吞吐量,衡量系統在功耗和成本約束下真正能穩定跑完多少工作流。


并發改變答案


在單智能體循環中,衡量性能是一件很簡單的事情:每一步都能完成得更快,那么整個工作流的速度也會變快。然而,系統往往并非單智能體循環,而是同時運行很多的智能體,共同爭搶CPU、內存、I/O以及加速器等資源。在這種高負載的情況下,系統的瓶頸也會隨之改變。


近期的一項公開分析,以739個匿名Claude Code會話為樣本,包含多輪推理、代碼生成和工具調用的代碼智能體工作流。該分析顯示,單個請求下CPU 端的處理和等待時間占總延遲的不到1%,而當32個請求并發時,這一比例最高可提升到15%。新增的延遲大部分源于調度與排隊,而非計算。


更快的核心可以提高任務的執行速度,但它無法避免排隊的現象。


此類等待,同樣會波及系統中最昂貴的組件——GPU。同樣在這個分析中,針對代碼執行智能體的研究預估,GPU的有效工作時間僅占整體實際運行時長的50%~60%。當智能體等待數據庫、檢索系統或沙箱返回結果時,GPU也會跟著陷入空轉。在這里,阿姆達爾定律依然適用:


“最昂貴的加速器,其實是那些正在等待系統其他組件響應的加速器。”


衡量理論容量,不如衡量實際交付的智能體工作流


英特爾提出了一個更實用的衡量指標,即每機架實際交付的智能體數量,也就是說,在既定功耗和成本范圍內,一個機架能夠在規定的吞吐量、質量和延遲要求下,穩定完成的智能體工作流數量。


如何理解實際交付容量呢?


每機架實際交付的智能體數量=每機架理論智能體數×路由效率×資源平衡度×卸載效率


理論容量反映機架可用的計算、內存和帶寬資源。路由效率反映任務的部署分配效果。資源平衡度體現因瓶頸和排隊造成的損失。卸載效率反映將基礎設施任務從通用核心移出后,系統所釋放出的容量。隨附的白皮書對這些因素及具體方法作了更詳細的說明。


真正的容量上限,不是理論吞吐量圖表的最高點,而是增加智能體數量后,延遲超過客戶目標的那個點。圖1給出了一個示例說明。


1787648610557808.png

圖1:容量指的是延遲曲線與目標閾值的交點。根據系統余量進行路由、任務卸載和狀態分層,會將曲線拐點向右移動(示意圖)。


英特爾打造完整的工作流解決方案


英特爾不是在“更快的核心”和“更多的核心”之間二選一,而是在構建一個系統,讓兩者都轉化為實際的工作產出。


保持狀態可用。帶寬讓智能體持續運行,容量則防止它重新啟動。借助英特爾至強6平面內存模式(Flat Memory Mode),CXL附加內存與原生DDR5可以共享同一個地址空間。根據英特爾與SAP的聯合評估,該方案的性能能夠達到全DDR5配置的96%,與此同時,內存TCO降低約25%。這為企業以更低成本維持更多活躍會話,提供了一條可行之路。


把容量還給系統。英特爾?數據保護與壓縮加速技術(英特爾? QAT)、數據流加速器(英特爾? DSA)和存內分析加速器(英特爾? IAA),可卸載原本會占用通用核心的基礎設施任務。公開資料顯示,使用英特爾IAA進行快照壓縮,快照完成速度可提高約1.2倍。卸載不再只是功能列表上的選項,而是將容量還給客戶。


按任務需求匹配算力資源。編排調度、工具執行、數據服務與狀態遷移的算力需求各不相同。至強產品系列依托統一架構,既有性能核的高單線程性能,也有能效核的高密度吞吐,這讓系統有能力為每一階段的工作流,匹配最合適的執行配置。


避免加速器陷入閑置。當然,企業既需要CPU,也需要專為智能體優化的GPU,英特爾正在籌備的Crescent Island GPU,正是為滿足這一需求而來。然而,如果GPU持續處在等待狀態,那它終究就只是一塊昂貴的硅片,白白消耗機架電力而已。這就是CPU在當下,依然事關重要的原因。至強承擔了智能體系統總調度者的角色,維持會話運行、工具調用、數據流通等,持續為加速器供給任務。


更具價值的評測標準


所有智能體AI的性能聲明,也包括英特爾自己所發布的在內,都應標明并發規模、延遲目標,以及理論性能與實際交付之間的損耗。一旦缺少這些,測試數據所代表的,也只是潛在上限,而無法反映實際的生產力。


英特爾將基于真實智能體軌跡,以明確的P99延遲目標為基準,公開單機柜智能體數量、路由效率、固定功能卸載所帶來的性能增益、GPU掛載系統的主機側效率,以及機柜功耗約束下的每瓦智能體數量等。


單線程性能重要,核心密度也重要。但最終勝出的系統,一定能讓每個線程都有活干、每個會話都保持活躍、每個加速器都充分運轉。


行業花了太多時間盤點機柜的硬件規格。現在,是時候衡量它的實際產出了。


結論

英特爾這套思路,是把智能體AI性能評測從“跑分邏輯”拉到“交付邏輯”。理論容量從來不是瓶頸的終點,延遲曲線與業務目標的交點才是。至強6平面內存模式讓CXL附加內存與DDR5共享地址空間,以約25%內存TCO降幅換取96%性能;QAT、DSA、IAA把基礎設施任務從通用核心卸下,把容量還給業務;性能核與能效核搭配讓不同階段匹配最合適算力;至強作為總調度者為GPU持續供給任務。



gg_20260512171736_266_20260622170931_179.png

特別推薦
技術文章更多>>
技術白皮書下載更多>>
熱門搜索

關閉

?

關閉