Inference 是一個基於 Solana、用於 LLM 推理的分佈式 GPU 集羣,爲DeepSeek V3和Llama 3.3等模型提供快速、可擴展、按 Token 付費的 API 。
據潮向研究,摩根大通 9月 2 日英偉達投資者會議紀要指出,英偉達對 FY28 年同比增長 70%的指引“感到舒適”,且該指引爲供給受限而非需求受限,若供給充足業務可增長一倍以上。推理已成爲數據中心業務中佔比最大且仍在擴大的部分,18 個月前推理與訓練大致各佔一半,目前推理佔比已超訓練且將持續上升。先進晶圓與內存是兩大供給瓶頸,英偉達與臺積電及三大內存供應商保持深度合作。 客戶結構持續拓寬,OpenAI和 Anthropic 目前約佔終端需求 20%,FY28 或接近 25%;新創雲廠商在 AI 計算基礎設施中佔比已超 50%。開源與閉源模型將共存,模型開發商毛利率正在改善。英偉達通過收入分成、PORTS-Pike 園區及 5000 億美元私人資本融資平臺支撐遠期需求。小摩維持增持評級,目標價 320 美元,基於約 20倍 CY2026 預期每股收益 15.87 美元。
據潮向研究,摩根士丹利 8月 Q2 業績報告指出,CoreWeave 單季新增淨活躍電力 500MW,超過歷史上任何一個季度,同比超過上年同期的三倍,管理層重申 2030 年前至少達到 8GW 目標。FY26 營收指引中值上調 2%至 124 億到 132 億美元,ARR 中值上調 3%至 185 億到 195 億美元。公司上調全年資本開支指引中值 12%至 355 億到 390 億美元,Q3 資本開支指引 115 億到 135 億美元,高於市場預期的 100 億美元。Managed Inference 平臺(託管推理平臺)ARR 從100 萬美元增長至超過 1 億美元,預計年底至少達 2.5 億美元。 研報判斷,Q2 調整後營業利潤率約 8%高於預期,但 Q3 利潤率指引 5.8%到 7.2%低於市場預期,Q4 利潤率需大幅提升才能實現全年指引。大摩預計 CoreWeave FY27 運營利潤率 15.9%、FY28爲 22.4%,自由現金流至 2028 年仍爲負,債務預計 2026 年底增至約 380 億美元。大摩維持 Equal-weight(與大盤持平)評級和 99 美元目標價
AI 推理雲初創公司 General Compute 從 Upper90 取得 4 億美元貸款,該筆交易爲全球首例以推理專用芯片作爲抵押品的融資項目。公司基於 SambaNova 自研 ASIC 芯片搭建專屬 AI 推理雲平臺,主打 Agent 類 AI 算力負載,相較傳統 GPU 雲擁有更快令牌處理速度和更低運行延遲;硬件可直接部署在傳統數據中心與閒置加密礦場設施。(mezha.net)
據路透社報道,中國 AI 初創公司 DeepSeek 正在開發自研 AI 芯片,三位知情人士透露,該芯片專爲推理場景設計,而非用於模型訓練。項目啓動約一年前,目前仍處早期階段,公司已與芯片設計、晶圓代工及存儲企業展開接觸,並悄然增招芯片設計工程師,未公開發布招聘信息。 若研發成功,DeepSeek 將減少對英偉達及華爲 Ascend 芯片的依賴,跟隨 OpenAI、Anthropic 等全球 AI 巨頭自研硬件的趨勢。受美國出口管制影響,DeepSeek 此前已從英偉達 H800 轉向華爲芯片,此次自研芯片被視爲重大戰略轉型。與此同時,DeepSeek 還計劃完成首輪外部融資,募資規模約 70 億美元,估值達 520 億至 590 億美元。
SemiAnalysis 在 X 平臺發文表示,AMD 中層管理人員正耗費 20 多名工程師的時間,試圖通過一個名爲“ATOM Inference Engine”的無實際用途的副項目擴大自身勢力範圍並獲得晉升,而不是將相關資源投入實際客戶 Meta 和 xAI 正在使用的推理引擎,例如 SGLang 和 vLLM。SemiAnalysis 表示,包括首席工程師和 AMD Fellow 在內的數十名 AMD 工程師曾私下聯繫該機構,稱由於 AMD 內部的辦公室政治以及部分中層管理人員的支持,他們無法在內部討論相關擔憂。中層管理人員耗費 20 多名全職工程師的時間開發這一幾乎沒有客戶的副項目,而參與該項目的工程師均爲“10x 工程師”,本應投入 vLLM 和 SGLang 等客戶推理引擎的開發工作。SemiAnalysis 稱,中層管理人員將試圖以唯一一個在生產環境中使用該項目的客戶作爲回應,即基於 Qwen 的阿里巴巴,但進一步調查顯示,這只是阿里巴巴企業業務部門在有限範圍內部署 ATOM,並非 Qwen 的主要業務部門。SemiAnalysis 表示,AMD 管理層將資源以及有限的內部 GPU 研發集羣從支持 vLLM 和 SGLang 等生產環境推理引擎的工程師處調走,轉而用於擴大自身勢力範圍和進行辦公室政治,這對 AMD 工程師極不尊重。
半導體巨頭 AMD 宣佈推出企業級 AI 編程平臺 AMD Instinct Coder,該平臺結合 AMD 芯片、Supermicro 服務器及 Spectro Cloud 軟件,旨在幫助企業在本地部署 AI 編碼助手,降低雲端 AI 模型使用成本並保護代碼及數據安全。AMD 表示,Instinct Coder 是一套“開箱即用”的端到端 AI 開發平臺,整合了 AMD EPYC 處理器、AMD Instinct GPU、Supermicro AI 服務器、Spectro Cloud PaletteAI Inference Launchpad 軟件,以及經過 AMD 優化的 GLM-5.2 模型,可用於代碼生成、應用現代化、自動化測試、代碼審查等軟件開發場景。AMD 稱,與依賴雲端前沿 AI 模型相比,Instinct Coder 可幫助企業降低最高 70%的總擁有成本(TCO),投資回收期最快可縮短至 6 個月。AMD 表示,越來越多企業希望利用 AI 提升開發效率,但同時面臨兩大挑戰:一方面,調用頂級雲端模型成本不斷增加;另一方面,將企業源代碼、知識產權和敏感數據交由第三方服務存在安全和合規風險。通過本地部署模式,Instinct Coder 可讓企業保持對數據和代碼的控制,同時提供更可預測的基礎設施成本。該平臺支持 Claude Code、OpenAI Codex、Visual Studio Code 和 Cursor 等開發工具,每個節點最多支持 50 名用戶(30 名併發用戶)。此外,Spectro Cloud 提供的 PaletteAI Inference Launchpad 可實現 AI 工作負載管理、模型路由、請求審計和成本監控,並支持在需要時調用 Anthropic、OpenAI、Google 或 xAI 等外部模型。AMD 表示,Instinct Coder 旨在幫助企業擺脫高昂雲端 AI 服務成本,在保障數據安全和自主控制的同時,加速 AI 驅動的軟件開發流程。
“白毛股神”Serenity 發文表示,儘管 UBS 報告中的部分觀察具有軼事層面的真實性,但更值得關注的是,關於 Anthropic 模型被蒸餾的相關中文報告正在增多。目前不少美國初創公司與科技企業在 AI 應用中,傾向使用更便宜的中國模型(如 DeepSeek),原因在於其單位任務成本顯著低於 Gemini、OpenAI 及 Anthropic 等推理模型。Serenity 認爲,這種趨勢在資本主義驅動下形成“典型悖論”——企業天然會選擇更低成本方案,從而削弱美國模型的領先優勢,同時提出美國需要在兩方面發力應對:一是構建更強的訪問控制與認證體系,例如面向美國本土的“重 KYC 前沿模型”,以及針對盟友的分級訪問機制,以降低模型被蒸餾與濫用風險;同時可引入類似“AI 版銀行級認證”的身份驗證體系(如生物識別+短時權限令牌),提升模型調用門檻,並通過監管手段限制賬號共享與訪問轉售。二是提升推理模型的成本效率,使其在價格與性能上全面壓制 DeepSeek 等競爭對手。Serenity 同時表示,當前一些高端模型頻繁被“蒸餾利用”,理想情況下應對接近 AGI 級別的模型訪問,增加更多摩擦成本。總結來看,美國 AI 產業的核心挑戰在於:既要實現“低成本推理能力”,也要建立類似金融體系級別的模型訪問安全機制。
知情人士稱,英偉達開始向中國客戶推銷其首款獨立中央處理器(CPU)產品 Vera。該芯片專爲 Agentic AI(自主智能體)系統設計,目前已進入量產階段,標誌着英偉達正嘗試通過 CPU 產品進一步拓展中國市場。消息人士稱,部分中國客戶已對 Vera 表現出興趣。其中一家大型中國雲計算公司計劃採購 300 餘臺搭載雙 Vera CPU 的服務器進行測試,並將在測試完成後決定是否擴大采購規模。Vera 基於 Arm Holdings 架構打造,是英偉達首次推出的獨立 CPU 產品。英偉達此前表示,Vera 在 AI 智能體相關計算任務中的性能可達到競爭對手同類產品的 1.8 倍,並預計該產品將在本財年結束前(截至明年 1 月底)貢獻約 200 億美元收入。報道指出,隨着 AI 行業重心逐步從模型訓練轉向推理計算(Inference),CPU 與定製芯片正獲得更多關注。Vera 也使英偉達直接與長期主導服務器 CPU 市場的 Intel 和 Advanced Micro Devices(AMD)展開競爭。知情人士表示,由於美國對高端 GPU 出口實施嚴格限制,相較於 GPU 產品,CPU 在中國市場面臨的監管障礙相對較小。目前部分中國客戶計劃先在海外數據中心部署 Vera 芯片進行測試。與此同時,軟件生態兼容性以及現有國產 AI 芯片部署體系,仍可能影響 Vera 後續的大規模採用。(Reuters)
據潮向研究,巴克萊 8月 31 日研報指出,Hot Chips 2026 大會核心主題已從“誰算力最強”轉向“誰能用最少電做最多事”,token/watt 成爲衡量 AI 硬件成功的最關鍵指標。數據中心電力供應受限,硬件供應商和超大規模廠商均在固定功率預算下追求系統性能極限。推理工作負載分區成爲關鍵架構分歧,英偉達與 Cerebras 採用預填充和解碼分離的分區方案,可在 token/千瓦指標上帶來約一個數量級提升;OpenAI Jalapeno 則將預填充、推測生成和解碼全部集成於同一芯片。巴克萊預計兩種方案將長期共存,分區方案可能隨時間佔據更大份額。
SemiAnalysis 在 X 平臺發文表示,AMD 中層管理人員正耗費 20 多名工程師的時間,試圖通過一個名爲“ATOM Inference Engine”的無實際用途的副項目擴大自身勢力範圍並獲得晉升,而不是將相關資源投入實際客戶 Meta 和 xAI 正在使用的推理引擎,例如 SGLang 和 vLLM。SemiAnalysis 表示,包括首席工程師和 AMD Fellow 在內的數十名 AMD 工程師曾私下聯繫該機構,稱由於 AMD 內部的辦公室政治以及部分中層管理人員的支持,他們無法在內部討論相關擔憂。中層管理人員耗費 20 多名全職工程師的時間開發這一幾乎沒有客戶的副項目,而參與該項目的工程師均爲“10x 工程師”,本應投入 vLLM 和 SGLang 等客戶推理引擎的開發工作。SemiAnalysis 稱,中層管理人員將試圖以唯一一個在生產環境中使用該項目的客戶作爲回應,即基於 Qwen 的阿里巴巴,但進一步調查顯示,這只是阿里巴巴企業業務部門在有限範圍內部署 ATOM,並非 Qwen 的主要業務部門。SemiAnalysis 表示,AMD 管理層將資源以及有限的內部 GPU 研發集羣從支持 vLLM 和 SGLang 等生產環境推理引擎的工程師處調走,轉而用於擴大自身勢力範圍和進行辦公室政治,這對 AMD 工程師極不尊重。
Anthropic 本週對 Claude 進行升級,爲 Claude Managed Agents 推出四項重要更新,進一步增強企業級 AI Agent 的可控性、部署靈活性和任務執行能力,包括:1、新增會話預算控制功能,用戶現在可以爲 Agent 會話設置預算上限,以實現更精準的成本管理。當會話達到預算限制後,系統將觸發事件並暫停運行,用戶可提高預算後恢復任務執行。2、開放推理區域控制能力,用戶可以選擇 Claude Managed Agents 運行位置,在全球可用資源中調度運行並按照標準價格計費,如果限制在美國區域運行,滿足區域部署需求,但費用爲標準價格的 1.1 倍。3、支持自動加載用戶倉庫中的 Skills 能力模塊;4、新增顧問模型功能。用戶可以配置一個更強大的模型作爲“顧問”,讓執行任務的 Agent 在會話過程中調用顧問模型進行第二意見分析,提高複雜任務處理質量。
半導體巨頭 AMD 宣佈推出企業級 AI 編程平臺 AMD Instinct Coder,該平臺結合 AMD 芯片、Supermicro 服務器及 Spectro Cloud 軟件,旨在幫助企業在本地部署 AI 編碼助手,降低雲端 AI 模型使用成本並保護代碼及數據安全。AMD 表示,Instinct Coder 是一套“開箱即用”的端到端 AI 開發平臺,整合了 AMD EPYC 處理器、AMD Instinct GPU、Supermicro AI 服務器、Spectro Cloud PaletteAI Inference Launchpad 軟件,以及經過 AMD 優化的 GLM-5.2 模型,可用於代碼生成、應用現代化、自動化測試、代碼審查等軟件開發場景。AMD 稱,與依賴雲端前沿 AI 模型相比,Instinct Coder 可幫助企業降低最高 70%的總擁有成本(TCO),投資回收期最快可縮短至 6 個月。AMD 表示,越來越多企業希望利用 AI 提升開發效率,但同時面臨兩大挑戰:一方面,調用頂級雲端模型成本不斷增加;另一方面,將企業源代碼、知識產權和敏感數據交由第三方服務存在安全和合規風險。通過本地部署模式,Instinct Coder 可讓企業保持對數據和代碼的控制,同時提供更可預測的基礎設施成本。該平臺支持 Claude Code、OpenAI Codex、Visual Studio Code 和 Cursor 等開發工具,每個節點最多支持 50 名用戶(30 名併發用戶)。此外,Spectro Cloud 提供的 PaletteAI Inference Launchpad 可實現 AI 工作負載管理、模型路由、請求審計和成本監控,並支持在需要時調用 Anthropic、OpenAI、Google 或 xAI 等外部模型。AMD 表示,Instinct Coder 旨在幫助企業擺脫高昂雲端 AI 服務成本,在保障數據安全和自主控制的同時,加速 AI 驅動的軟件開發流程。
AI 推理雲初創公司 General Compute 從 Upper90 取得 4 億美元貸款,該筆交易爲全球首例以推理專用芯片作爲抵押品的融資項目。公司基於 SambaNova 自研 ASIC 芯片搭建專屬 AI 推理雲平臺,主打 Agent 類 AI 算力負載,相較傳統 GPU 雲擁有更快令牌處理速度和更低運行延遲;硬件可直接部署在傳統數據中心與閒置加密礦場設施。(mezha.net)
據路透社報道,Meta 計劃自 9 月起量產自研數據中心 AI 芯片“Iris”,作爲其 Meta Training and Inference Accelerators 四代項目的一部分,以提升 Facebook和 Instagram 等平臺 AI 能力並降低對 Nvidia、AMD 等外部 GPU 依賴。內部備忘錄顯示,Iris 僅用 6 周完成測試,無重大缺陷;Meta 計劃今年部署 7 吉瓦算力,並在 2027 年增至 14 吉瓦,2024年 AI 基礎設施支出最高或達 1450 億美元。爲保障擴張,公司已與三星電子、Sandisk 和住友電工簽署長期供應協議,應對內存與 AI 芯片“漲價”與短缺。
據潮向研究,摩根士丹利 2026年 9月 4 日研報指出,超大規模廠商數據中心資本開支 2027 年將達 1.5 萬億美元,同比增長 60%,2028 年增速驟降至 12%。AI 算力總容量將從 2025 年的 35 吉瓦增長至 2028 年的 145 吉瓦,增長 4 倍。定製芯片在增量容量中佔比從 34%升至 66%,谷歌 TPU 和亞馬遜 Trainium 主導這一轉變。GenAI 投資回報率在 25%至 50%之間,模型層在自有基礎設施上運行 API 回報最高(約 46%)。約 25%的標普 500 公司已量化 GenAI 收益,高於一年前的 14%。
據潮向研究,摩根大通 9月 2 日英偉達投資者會議紀要指出,英偉達對 FY28 年同比增長 70%的指引“感到舒適”,且該指引爲供給受限而非需求受限,若供給充足業務可增長一倍以上。推理已成爲數據中心業務中佔比最大且仍在擴大的部分,18 個月前推理與訓練大致各佔一半,目前推理佔比已超訓練且將持續上升。先進晶圓與內存是兩大供給瓶頸,英偉達與臺積電及三大內存供應商保持深度合作。 客戶結構持續拓寬,OpenAI和 Anthropic 目前約佔終端需求 20%,FY28 或接近 25%;新創雲廠商在 AI 計算基礎設施中佔比已超 50%。開源與閉源模型將共存,模型開發商毛利率正在改善。英偉達通過收入分成、PORTS-Pike 園區及 5000 億美元私人資本融資平臺支撐遠期需求。小摩維持增持評級,目標價 320 美元,基於約 20倍 CY2026 預期每股收益 15.87 美元。
據潮向研究,巴克萊 8月 31 日研報指出,Hot Chips 2026 大會核心主題已從“誰算力最強”轉向“誰能用最少電做最多事”,token/watt 成爲衡量 AI 硬件成功的最關鍵指標。數據中心電力供應受限,硬件供應商和超大規模廠商均在固定功率預算下追求系統性能極限。推理工作負載分區成爲關鍵架構分歧,英偉達與 Cerebras 採用預填充和解碼分離的分區方案,可在 token/千瓦指標上帶來約一個數量級提升;OpenAI Jalapeno 則將預填充、推測生成和解碼全部集成於同一芯片。巴克萊預計兩種方案將長期共存,分區方案可能隨時間佔據更大份額。
SemiAnalysis 在 X 平臺發文表示,AMD 中層管理人員正耗費 20 多名工程師的時間,試圖通過一個名爲“ATOM Inference Engine”的無實際用途的副項目擴大自身勢力範圍並獲得晉升,而不是將相關資源投入實際客戶 Meta 和 xAI 正在使用的推理引擎,例如 SGLang 和 vLLM。SemiAnalysis 表示,包括首席工程師和 AMD Fellow 在內的數十名 AMD 工程師曾私下聯繫該機構,稱由於 AMD 內部的辦公室政治以及部分中層管理人員的支持,他們無法在內部討論相關擔憂。中層管理人員耗費 20 多名全職工程師的時間開發這一幾乎沒有客戶的副項目,而參與該項目的工程師均爲“10x 工程師”,本應投入 vLLM 和 SGLang 等客戶推理引擎的開發工作。SemiAnalysis 稱,中層管理人員將試圖以唯一一個在生產環境中使用該項目的客戶作爲回應,即基於 Qwen 的阿里巴巴,但進一步調查顯示,這只是阿里巴巴企業業務部門在有限範圍內部署 ATOM,並非 Qwen 的主要業務部門。SemiAnalysis 表示,AMD 管理層將資源以及有限的內部 GPU 研發集羣從支持 vLLM 和 SGLang 等生產環境推理引擎的工程師處調走,轉而用於擴大自身勢力範圍和進行辦公室政治,這對 AMD 工程師極不尊重。
OpenAI 公佈其首款定製推理芯片 Jalapeño 的初步測試結果。數據顯示,該芯片在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 等模型上,相較對比系統實現 1.5 至 1.9 倍 的峯值每瓦性能提升,並將端到端延遲降低 1.7 至 3.6 倍;在高交互負載下,性能提升達 2.1 至 4.1 倍。
據潮向研究,摩根士丹利 8月 Q2 業績報告指出,CoreWeave 單季新增淨活躍電力 500MW,超過歷史上任何一個季度,同比超過上年同期的三倍,管理層重申 2030 年前至少達到 8GW 目標。FY26 營收指引中值上調 2%至 124 億到 132 億美元,ARR 中值上調 3%至 185 億到 195 億美元。公司上調全年資本開支指引中值 12%至 355 億到 390 億美元,Q3 資本開支指引 115 億到 135 億美元,高於市場預期的 100 億美元。Managed Inference 平臺(託管推理平臺)ARR 從100 萬美元增長至超過 1 億美元,預計年底至少達 2.5 億美元。 研報判斷,Q2 調整後營業利潤率約 8%高於預期,但 Q3 利潤率指引 5.8%到 7.2%低於市場預期,Q4 利潤率需大幅提升才能實現全年指引。大摩預計 CoreWeave FY27 運營利潤率 15.9%、FY28爲 22.4%,自由現金流至 2028 年仍爲負,債務預計 2026 年底增至約 380 億美元。大摩維持 Equal-weight(與大盤持平)評級和 99 美元目標價