【導(dǎo)讀】過去一周,一個(gè)代號(hào)為Ox-Alpha的神秘模型橫掃AI圈,以匿名之姿同時(shí)沖上OpenCode和OpenRouter調(diào)用量榜首,終結(jié)了DeepSeek連續(xù)56天的霸榜紀(jì)錄。開發(fā)者們驚呼“它在屠殺我們的內(nèi)部基準(zhǔn)”,全網(wǎng)競(jìng)猜其身份——谷歌?海外神秘團(tuán)隊(duì)?昨天,答案終于揭曉:它正是智譜剛剛開源的GLM-5.3-Flash,GLM-5系列首個(gè)原生多模態(tài)模型。但比“牛來”爆火更值得關(guān)注的,是一個(gè)正在浮出水面的關(guān)鍵信號(hào):在匿名測(cè)試期間,所有推理請(qǐng)求均由國(guó)產(chǎn)芯片集群支撐,訓(xùn)練端或由海光DCU等國(guó)產(chǎn)芯片支持。
不到一天時(shí)間,Ox-Alpha 同時(shí)沖上 OpenRouter 和 OpenCode 的調(diào)用量榜首,刷新了 OpenRouter 的模型發(fā)布紀(jì)錄,也結(jié)束了 DeepSeek 連續(xù)56天霸榜的局面。短時(shí)間內(nèi),用戶累計(jì)調(diào)用量達(dá)到62T Token。
Hermes Agent 創(chuàng)始人在測(cè)試后直言:“This model is slaughtering all our internal benchmarks. What the actual fuck is it??”——這個(gè)模型幾乎在“屠殺”他們所有的內(nèi)部測(cè)試基準(zhǔn)。
于是,全網(wǎng)開始猜:這到底是誰家的模型?有人猜是谷歌 Gemini,有人懷疑是某個(gè)海外大廠偷偷放出來測(cè)試的新模型,甚至還有人拿出各種截圖對(duì)比,稱它的表現(xiàn)疑似已經(jīng)明顯超過 Fable 5。一時(shí)間,關(guān)于 Ox-Alpha 的身份猜測(cè)幾乎席卷了整個(gè)AI圈。
直到昨天,答案終于揭曉。Ox-Alpha,正是智譜的 GLM-5.3-Flash。而“Flash”這個(gè)名字,反而很容易讓人低估它。這里的 Flash,并不意味著能力上的“輕量版”或“降檔版”。
前沿智能進(jìn)入普惠時(shí)代
總結(jié)一下,智譜的GLM-5.3-Flash有什么關(guān)鍵點(diǎn):
第一,GLM首個(gè)原生多模態(tài)模型。GLM-5.3-Flash(320B-A18B)正式上線并開源,是GLM-5系列首個(gè)原生多模態(tài)模型,支持1M上下文,重點(diǎn)面向Coding、Agent及復(fù)雜專業(yè)任務(wù)。
第二,能力進(jìn)入全球第一梯隊(duì)。模型在AA綜合智能指數(shù)中獲得57分,與Claude Opus 4.8持平;在編程能力測(cè)試中表現(xiàn)對(duì)標(biāo)Opus 4.8,同時(shí)全面超過參數(shù)量更大的GLM-5.2。
第三,同等能力,價(jià)格大幅下降。GLM-5.3-Flash價(jià)格僅為GLM-5.3的1/10,限時(shí)優(yōu)惠低至1/20,約為Claude Opus 4.8的1/40,主打“前沿能力+低成本”。
第四,匿名測(cè)試期間直接爆火。正式發(fā)布前,模型以匿名身份Ox-Alpha登陸OpenCode和OpenRouter進(jìn)行大規(guī)模測(cè)試,迅速成為雙平臺(tái)熱門模型并創(chuàng)下調(diào)用量新高,相關(guān)請(qǐng)求全部由國(guó)產(chǎn)芯片提供算力支持。
第五,架構(gòu)、Coding和專業(yè)Agent全面升級(jí)。模型采用稀疏注意力與線性注意力混合架構(gòu),并引入mHC等新技術(shù),將注意力計(jì)算量和KV緩存顯著降低;原生視覺能力則讓模型可以“觀察—驗(yàn)證—改進(jìn)”自己的輸出,不僅能用于前端、游戲、3D等視覺Coding,也進(jìn)一步拓展到金融、法律、Office文檔等專業(yè)工作場(chǎng)景。



國(guó)產(chǎn)芯片正在扛起大旗
這次GLM-5.3-Flash最值得關(guān)注的,可能不只是模型本身,而是它背后的算力——國(guó)產(chǎn)芯片開始真正扛起前沿模型的大規(guī)模推理服務(wù)。
過去一周,智譜首次嘗試讓大規(guī)模真實(shí)流量跑在國(guó)產(chǎn)芯片集群上。國(guó)產(chǎn)芯片單卡算力和內(nèi)存容量相對(duì)有限,而GLM-5.3-Flash又支持最長(zhǎng)1M上下文,長(zhǎng)上下文帶來的內(nèi)存容量和帶寬壓力非常大。因此,智譜圍繞國(guó)產(chǎn)芯片的底層架構(gòu)進(jìn)行了大量針對(duì)性優(yōu)化,甚至采用“以算力換帶寬、以通信換顯存”等策略。
在軟件棧上,團(tuán)隊(duì)基于SGLang打造了專用推理引擎,并結(jié)合節(jié)點(diǎn)內(nèi)張量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合緩存量化以及Layer Split等技術(shù),盡可能把有限的硬件資源榨干。集群層面,則采用生產(chǎn)級(jí)的Encode–Prefill–Decode(EPD)分離架構(gòu),把多模態(tài)編碼、Prompt預(yù)填充和逐Token解碼拆成可以獨(dú)立調(diào)度、獨(dú)立擴(kuò)縮容的工作池,從而提升整個(gè)推理集群的利用率和穩(wěn)定性。
最終的結(jié)果相當(dāng)直接:相比同一硬件上的初始基線,端到端服務(wù)性能提升了3倍,硬件效率和單Token成本已經(jīng)達(dá)到與主流英偉達(dá)GPU相當(dāng)?shù)乃健?/p>
而在訓(xùn)練端,同樣值得關(guān)注。訓(xùn)練或由海光DCU等國(guó)產(chǎn)芯片支持。以海光DCU為代表的國(guó)產(chǎn)GPGPU,不僅提供訓(xùn)練所需要的通用并行算力,還通過DTK軟件棧、算子庫(kù)和集群互聯(lián)能力,盡可能降低從主流GPU生態(tài)遷移過來的成本。換句話說,國(guó)產(chǎn)芯片正在從“能不能跑大模型”,走向“能不能把大模型規(guī)模化訓(xùn)練起來”
結(jié)論
GLM-5.3-Flash的爆火,不只是智譜在模型能力上的又一次躍升,它更是一份關(guān)于“國(guó)產(chǎn)算力能不能扛住前沿模型”的實(shí)戰(zhàn)報(bào)告。匿名測(cè)試一周,真實(shí)流量跑在國(guó)產(chǎn)芯片集群上,端到端服務(wù)性能比初始基線提升3倍,硬件效率和單Token成本對(duì)標(biāo)主流英偉達(dá)GPU——這組數(shù)據(jù)說明,國(guó)產(chǎn)芯片正在從“能跑”走向“能規(guī)模化跑起來”。訓(xùn)練端或由海光DCU支撐,推理端以混合架構(gòu)與EPD分離調(diào)度榨干硬件資源,智譜與國(guó)產(chǎn)芯片的這次深度協(xié)同,為“國(guó)產(chǎn)大模型+國(guó)產(chǎn)算力”的組合提供了一個(gè)極具說服力的實(shí)戰(zhàn)樣本。




