智譜GLM-5.3-Flash正式認領神祕模型「牛來」(Ox-Alpha)。該模型測試期間每日100萬億token的流量,全部由超過10萬張國產芯片承載,智譜稱其成本效率已與英偉達GPU相當。傳聞稱芯片供應或來自華爲、摩爾線程與海光。此外,模型定價爲Claude Opus 4.8的1/40。
8月26日,智譜正式確認:此前在開發者社區引發熱議的匿名模型Ox Alpha(中文社區稱「牛來」),就是其最新發布的GLM-5.3-Flash。模型代號靈感來源於國內近期熱映電影《牛來》。
這個模型在正式亮相前,以匿名形式在OpenRouter和OpenCode上免費開放測試,5天內流量累計超過50萬億token,刷新了兩個平台的流量增長紀錄,當前使用量已超過DeepSeek的兩倍以上。但真正引發市場關注的,是智譜隨後披露的一個細節:這些流量,全部由國產芯片承載。
週四港股盤初, $智譜 (02513.HK)$ 應聲大漲逾7%,股價報1106港元; $MINIMAX-W (00100.HK)$ 跟漲6%,昨日該公司公佈上市後的首份中期成績單。

上半年,MINIMAX實現收入1.17億美元,同比增長283.1%,超過2025年全年7900萬美元的收入規模。過去以海螺AI等AI原生產品爲主的收入結構,正在向開放平台和企業服務傾斜。上半年,開放平台及其他基於AI的企業服務收入達到7393萬美元,同比增長703.1%,收入佔比升至63.4%,成爲公司第一大收入來源;AI原生產品收入則同比增長100.9%至4264萬美元。
智譜在官方技術文檔中表示,調用超過10萬張國產芯片集群用於該模型推理服務,「硬件效率及單token成本已經達到了與主流英偉達GPU相當的水平」。
半導體研究機構SemiAnalysis隨即在X平台發文評論:“所有流量均由國產芯片承載,硬件效率和單token成本已可與英偉達GPU相媲美。繼Jalapeño(OpenAI自研推理芯片)昨日宣佈之後,CUDA護城河再度受到考驗。”

10萬張國產卡:從測試到生產
智譜在技術文檔中描述了這套國產芯片集群的部署細節。
單張芯片的主要瓶頸在於內存容量與帶寬,支持長達100萬token的上下文長度尤爲困難。爲此,智譜在SGLang基礎上構建了專用推理引擎,採用W8A8量化、INT8/FP8/BF16混合緩存量化,以及節點內張量並行等技術,並引入生產級Encode–Prefill–Decode(EPD)分離式架構,將多模態編碼、prompt預填充和逐token解碼拆分爲可獨立調度的工作池。
智譜稱,與同一硬件上的初始基線相比,端到端服務性能提升了3倍。
據《晚點LatePost》了解,這批芯片的供應商或來自華爲、摩爾線程與海光。智譜官方對此未予置評,技術文檔中也未明確具體芯片型號。
SemiAnalysis在評論中特別指出,此前有觀點認爲只有頂級前沿實驗室才具備每日100萬億token的算力規模,「而這裏每日100萬億token的免費流量,全部跑在國產芯片上。」

模型本身:對標DeepSeek,定價是Claude Opus 4.8的1/40
GLM-5.3-Flash的參數規模爲320B總參數,激活參數18B,參數量約爲上一代旗艦GLM-5.3的40%,與DeepSeek V4 Flash幾乎持平。
性能方面,智譜官方評測顯示,GLM-5.3-Flash在Artificial Analysis Intelligence Index(AA綜合智能指數)中取得57分,超過上一代旗艦GLM-5.2,與Anthropic的Claude Opus 4.8持平,也高於DeepSeek旗艦模型V4 Pro正式版的53分。

定價方面,GLM-5.3-Flash每百萬token輸入0.8元,輸出2.8元,緩存命中價格0.23元,爲GLM-5.3的十分之一。上線前兩週實行半價。
智譜表示,GLM-5.3-Flash定價爲GLM-5.3的1/10,限時折扣內爲GLM-5.3的1/20,爲Claude Opus 4.8的1/40。
與調價後的DeepSeek V4 Flash相比(谷時輸入1.5元、輸出4.5元),GLM-5.3-Flash在絕大多數常規調用場景下更便宜。

架構創新:激活參數和層數近乎減半
GLM-5.3-Flash採用了與GLM-5.3完全不同的架構設計,這也是其能夠以更低成本實現更高性能的核心原因。
與GLM-4.5相比,GLM-5.3-Flash總參數量相近(355B vs. 320B),但激活參數量從32B降至18B,層數從92層減至45層,幾乎減半。
智譜稱,GLM-5.3-Flash是首個採用稀疏注意力與線性注意力混合架構的開源前沿模型。相較於GLM-5.3,其注意力計算量與KV緩存大小分別降低了3.01倍和4.44倍。
此外,該模型是GLM-5系列首個原生多模態模型,支持圖像和視頻輸入,也是智譜戰略聚焦coding以來首次推出具備多模態能力的新模型。

漲價潮中的低價突圍
GLM-5.3-Flash的發佈,發生在中國AI模型市場一輪集體漲價之後。
Kimi K3輸出價格高達每百萬token 100元,超過前代K2.6三倍以上;智譜上半年提價後輸出價格也達到28元;DeepSeek V4 Pro從6元漲至13.5元,高峰時段27元;DeepSeek V4 Flash輸出價格從2元漲至4.5元,高峰時段9元。
漲價的直接後果是需求外溢。《晚點LatePost》指出,DeepSeek V4 Flash提價後,在OpenCode平台上的調用量下滑了一半,這部分需求成爲國產模型廠商新的增長空間。
GLM-5.3-Flash的定價策略,正是瞄準了這一缺口。
編輯/rice