
DeepSeek準備上市,呢單新聞值得大家留意。因為由佢嘅估值,可以睇到成個中美人工智能競爭嘅形勢。路透社九月九日引述消息人士報道,DeepSeek已經聘請中信證券,籌備喺上海科創板上市,希望今年啟動程序。公司另一輪融資嘅估值,據報可能達五千億元人民幣,約七百五十億美元。不過,呢個係融資估值,正式上市嘅時間、集資額同招股定價,仍然未定。七百幾億美元,究竟值唔值?要回答呢條問題,就要將DeepSeek放返入世界大模型競爭嘅版圖。
七百幾億美元,聽落已經好大。但同美國主要對手比較,差距仍然驚人。相關報道提到,OpenAI上市估值目標約一萬億美元,Anthropic則可能高達兩萬億美元。呢啲係上市目標,未係最終成交價,同DeepSeek嘅融資估值亦唔係完全同一口徑。不過,按呢個尺度粗略比較,就分別相差約十三倍同二十七倍。點解會差咁遠?DeepSeek喺某啲模型能力上,可以追近美國,點解公司估值仍然差一大截?我認為,市場唔單止睇今日個模型有幾叻,仲睇公司未來可以調動幾多資源、服務幾多客戶,同埋有冇能力一代接一代咁競爭。要明白呢個差距,就要先睇資金、渠道同算力。
今次我集中講中美各三個主要競爭者。美國係OpenAI、Anthropic,同Google旗下嘅Gemini。呢個係我按長期商業競爭條件作出嘅判斷,唔係照住某一張模型測試排行榜排位。OpenAI有ChatGPT呢個用戶入口,再發展企業服務、開發者接口同工作工具。佢要爭取嘅,係令AI進入更多人日常生活同工作。Anthropic就集中喺編程、專業工作同企業應用,爭取令Claude進入客戶日常工作流程。企業如果用佢寫程式、分析文件、處理工作,形成使用習慣,就有機會持續付費。Google嘅條件更加全面。Gemini背後有研究團隊、雲計算、自家運算晶片,同龐大嘅既有產品渠道。所以,模型本身要叻,當然重要。但你仲要令客戶接觸得到、用得方便,企業可以部署,服務可以穩定運行。呢幾樣條件加埋,先形成一盤有規模嘅生意。
中國呢邊,我會集中睇DeepSeek、阿里巴巴嘅通義千問,同字節跳動嘅豆包。DeepSeek有率先打響全球品牌嘅優勢。佢靠技術成果吸引國際注意,建立咗聲譽。呢種知名度,對吸引開發者、人才同投資者都有價值。但佢要繼續證明,技術影響力可以變成自己嘅持續收入同長期資源。阿里巴巴嘅優勢就係雲計算同分銷網絡。佢有阿里雲,有企業客戶基礎,有銷售同服務團隊。通義千問可以經現成渠道進入企業,帶動運算、部署同相關服務需求。阿里可以喺模型以外嘅環節獲得回報,呢個係獨立模型公司未必具備嘅條件。豆包背後係字節跳動。佢有雄厚業務支持,亦有做消費者產品、推廣產品同維持用戶使用習慣嘅經驗。我尤其睇重佢嘅C端能力:普通人會唔會日日打開你個產品,會唔會用慣咗,對長期競爭非常重要。所以,呢三個各有本錢:DeepSeek有技術聲譽同品牌,阿里有雲端同企業渠道,豆包有母公司資源同消費者入口。
其他公司某一代模型喺測試表現好,值得留意。但跑出一個好成績,唔會自動帶嚟同等嘅品牌、客戶同資金實力。你今輪集資成功,可以做下一代;再下一代呢?研究員要出糧,設備要更新,服務客戶亦要持續使錢。集資係一輪一輪,但開支係日日發生嘅。阿里同字節背後有龐大業務,可以支持長期投資。母公司有錢,唔等於全部錢都投落AI,但佢哋有更大空間,選擇投入幾多、投入幾耐。新創公司往往要先說服下一輪投資者,先有資源繼續擴張。連阿里都要再集資。八月,阿里宣布約八百億港元配股,計劃將所得淨額投入晶片、基建同模型等AI能力。連呢種規模嘅公司都要補充資金,就知道前沿AI競爭需要幾大投入。大平台仲有專有數據同業務反饋。喺獲得適當授權之下,獨有嘅業務資料,可以幫助改善特定任務、評估模型,同了解客戶需要。不過,唔係所有數據都有同樣價值,亦唔可以將雲端客戶資料,當成平台可以任意攞去訓練嘅資產。有現成業務、有用戶,就有機會持續發現模型喺實際工作入面有乜不足,再改善產品。新公司要追趕嘅,就包括呢套能力。
講到中國同美國比較,中國團隊一個值得重視嘅長處,係算法同工程效率。DeepSeek公開嘅研究,包括混合專家架構、減少記憶體需求嘅注意力設計、低精度運算,同改善晶片之間嘅通訊。佢展示咗,有限資源可以透過精巧設計,發揮更大作用。混合專家,可以簡單理解成一間公司有好多專家,每次按需要調動其中一部分,唔使所有人一齊開工。不過,MoE,即混合專家,並非DeepSeek首創。海外早已有相關研究,DeepSeek嘅貢獻係改良同整合,令實際運作更有效率。問題係,好方法會擴散。中國可以吸收海外研究,美國亦可以吸收中國研究。你諗到一個方法慳算力,對手掌握之後,同樣可以用,再配合佢本來更大嘅資源繼續推進。所以,算法效率係重要優勢,但未必係永久獨有嘅優勢。當大家都學識更有效率嘅方法,資源規模就仍然影響競爭。
比較算力,唔可以淨係數晶片張數,仲要睇晶片代際。舉個規模例子,十萬Blackwell B二零零,按相同FP八非稀疏理論峰值換算,大約相當於二十三萬張H一零零 SXM。即係唔單止可能張數更多,每張嘅能力亦有差距。呢個係硬件換算示例,唔係確認某個模型實際使用咗幾多晶片。換成華為昇騰,亦要用指定型號同相同精度比較。更重要嘅係,即使單卡峰值加埋相等,都唔代表實際訓練效率相同。大量晶片要連接起嚟,資料要傳得夠快,供電、散熱、軟件同故障處理都要配合,先可以有效運行。真正要睇嘅,係一間公司可以持續調動幾大規模嘅有效算力。至於OpenAI同DeepSeek今日實際相差幾多倍,公開資料未足以作出可靠嘅同口徑結論,唔應該將十倍、二十倍當成已確認數字。但晶片取得能力同大規模系統運作能力,確實係比較競爭條件時必須考慮嘅問題。
算力重要,唔單止因為訓練模型。模型訓練完,每次服務客戶,仍然要運算。傳統軟件當然亦有推算,但一般文書、資料查詢嗰類功能,每次操作需要嘅運算,相對有限。生成式AI通常每次都要運行模型,處理輸入,再逐步生成答案。答案愈長、推理愈深入,往往就需要更多資源。你唔可以以為模型做好,就可以用極低嘅額外成本,無限量賣畀所有人。快取、批次處理同算法改善可以降低成本,但客戶使用規模增加,仍然會帶嚟持續嘅推論需求。一個人問,同一百萬人同時問,係完全唔同嘅生產規模。客戶想用,你要有容量;客戶願意畀錢,你要交到速度、穩定性同質素。唔夠算力,就可能要排隊、限次數,或者改用較細嘅模型。Sora就提供咗一個例子。報道將OpenAI停運Sora,同高成本、需求減弱及釋放算力聯繫起來。呢件事帶出嘅問題係:連資源雄厚嘅公司,都要計算同一批算力放喺邊項業務,先有更好回報。算力限制有兩種表現。一種係客戶想用,但容量接唔晒;另一種係產品可以運行,但成本同收入唔合算,公司要轉移資源。前者限制收入規模,後者影響盈利能力。所以,算力就係AI公司嘅生產能力。你有好模型,好似有好產品設計;但你仲要有足夠產能,先可以持續交貨。
AI公司要同時照顧今日同將來:現有模型要服務客戶,下一代又要繼續研究。資源有限,就要喺兩邊取捨。算力充裕,可以同時試更多研究方向、承受更多失敗,亦有更大空間擴張服務。呢個就帶返去DeepSeek嘅估值。市場買一間AI公司,包含對佢未來幾代模型、客戶規模同盈利能力嘅預期。今日某啲測試成績接近,唔代表雙方可以服務同樣多客戶,或者有同樣多資源繼續推進。我認為,算力供應同使用效率,係解釋中美主要模型公司估值差距嘅重要結構性因素。佢唔係唯一原因,亦唔係多十倍算力就應該值十倍錢,但佢會同時影響研究速度、服務容量同成本。
所以,DeepSeek七百幾億美元值唔值?我唔會因為佢比美國同行平好多,就立即話抵買。佢有技術、有品牌,但要睇新資金可以幫佢建立幾多長期能力。美國公司估值高,亦唔保證合理;如果龐大投入換唔到足夠回報,一樣可以估得太貴。DeepSeek上市最值得睇嘅,就係佢能否將資金轉化成有效算力,再將有效算力轉化成持續研究同有收入嘅服務。算法幫佢爭到重要位置,長期資源決定佢守唔守得住,而算力嘅商業回報,就決定投資者付出嘅價錢有冇根據。