Inference 是一个基于 Solana、用于 LLM 推理的分布式 GPU 集群,为DeepSeek V3和Llama 3.3等模型提供快速、可扩展、按 Token 付费的 API 。
据潮向研究,摩根大通 9月 2 日英伟达投资者会议纪要指出,英伟达对 FY28 年同比增长 70%的指引“感到舒适”,且该指引为供给受限而非需求受限,若供给充足业务可增长一倍以上。推理已成为数据中心业务中占比最大且仍在扩大的部分,18 个月前推理与训练大致各占一半,目前推理占比已超训练且将持续上升。先进晶圆与内存是两大供给瓶颈,英伟达与台积电及三大内存供应商保持深度合作。 客户结构持续拓宽,OpenAI和 Anthropic 目前约占终端需求 20%,FY28 或接近 25%;新创云厂商在 AI 计算基础设施中占比已超 50%。开源与闭源模型将共存,模型开发商毛利率正在改善。英伟达通过收入分成、PORTS-Pike 园区及 5000 亿美元私人资本融资平台支撑远期需求。小摩维持增持评级,目标价 320 美元,基于约 20倍 CY2026 预期每股收益 15.87 美元。
据潮向研究,摩根士丹利 8月 Q2 业绩报告指出,CoreWeave 单季新增净活跃电力 500MW,超过历史上任何一个季度,同比超过上年同期的三倍,管理层重申 2030 年前至少达到 8GW 目标。FY26 营收指引中值上调 2%至 124 亿到 132 亿美元,ARR 中值上调 3%至 185 亿到 195 亿美元。公司上调全年资本开支指引中值 12%至 355 亿到 390 亿美元,Q3 资本开支指引 115 亿到 135 亿美元,高于市场预期的 100 亿美元。Managed Inference 平台(托管推理平台)ARR 从100 万美元增长至超过 1 亿美元,预计年底至少达 2.5 亿美元。 研报判断,Q2 调整后营业利润率约 8%高于预期,但 Q3 利润率指引 5.8%到 7.2%低于市场预期,Q4 利润率需大幅提升才能实现全年指引。大摩预计 CoreWeave FY27 运营利润率 15.9%、FY28为 22.4%,自由现金流至 2028 年仍为负,债务预计 2026 年底增至约 380 亿美元。大摩维持 Equal-weight(与大盘持平)评级和 99 美元目标价
AI 推理云初创公司 General Compute 从 Upper90 取得 4 亿美元贷款,该笔交易为全球首例以推理专用芯片作为抵押品的融资项目。公司基于 SambaNova 自研 ASIC 芯片搭建专属 AI 推理云平台,主打 Agent 类 AI 算力负载,相较传统 GPU 云拥有更快令牌处理速度和更低运行延迟;硬件可直接部署在传统数据中心与闲置加密矿场设施。(mezha.net)
据路透社报道,中国 AI 初创公司 DeepSeek 正在开发自研 AI 芯片,三位知情人士透露,该芯片专为推理场景设计,而非用于模型训练。项目启动约一年前,目前仍处早期阶段,公司已与芯片设计、晶圆代工及存储企业展开接触,并悄然增招芯片设计工程师,未公开发布招聘信息。 若研发成功,DeepSeek 将减少对英伟达及华为 Ascend 芯片的依赖,跟随 OpenAI、Anthropic 等全球 AI 巨头自研硬件的趋势。受美国出口管制影响,DeepSeek 此前已从英伟达 H800 转向华为芯片,此次自研芯片被视为重大战略转型。与此同时,DeepSeek 还计划完成首轮外部融资,募资规模约 70 亿美元,估值达 520 亿至 590 亿美元。
SemiAnalysis 在 X 平台发文表示,AMD 中层管理人员正耗费 20 多名工程师的时间,试图通过一个名为“ATOM Inference Engine”的无实际用途的副项目扩大自身势力范围并获得晋升,而不是将相关资源投入实际客户 Meta 和 xAI 正在使用的推理引擎,例如 SGLang 和 vLLM。SemiAnalysis 表示,包括首席工程师和 AMD Fellow 在内的数十名 AMD 工程师曾私下联系该机构,称由于 AMD 内部的办公室政治以及部分中层管理人员的支持,他们无法在内部讨论相关担忧。中层管理人员耗费 20 多名全职工程师的时间开发这一几乎没有客户的副项目,而参与该项目的工程师均为“10x 工程师”,本应投入 vLLM 和 SGLang 等客户推理引擎的开发工作。SemiAnalysis 称,中层管理人员将试图以唯一一个在生产环境中使用该项目的客户作为回应,即基于 Qwen 的阿里巴巴,但进一步调查显示,这只是阿里巴巴企业业务部门在有限范围内部署 ATOM,并非 Qwen 的主要业务部门。SemiAnalysis 表示,AMD 管理层将资源以及有限的内部 GPU 研发集群从支持 vLLM 和 SGLang 等生产环境推理引擎的工程师处调走,转而用于扩大自身势力范围和进行办公室政治,这对 AMD 工程师极不尊重。
半导体巨头 AMD 宣布推出企业级 AI 编程平台 AMD Instinct Coder,该平台结合 AMD 芯片、Supermicro 服务器及 Spectro Cloud 软件,旨在帮助企业在本地部署 AI 编码助手,降低云端 AI 模型使用成本并保护代码及数据安全。AMD 表示,Instinct Coder 是一套“开箱即用”的端到端 AI 开发平台,整合了 AMD EPYC 处理器、AMD Instinct GPU、Supermicro AI 服务器、Spectro Cloud PaletteAI Inference Launchpad 软件,以及经过 AMD 优化的 GLM-5.2 模型,可用于代码生成、应用现代化、自动化测试、代码审查等软件开发场景。AMD 称,与依赖云端前沿 AI 模型相比,Instinct Coder 可帮助企业降低最高 70%的总拥有成本(TCO),投资回收期最快可缩短至 6 个月。AMD 表示,越来越多企业希望利用 AI 提升开发效率,但同时面临两大挑战:一方面,调用顶级云端模型成本不断增加;另一方面,将企业源代码、知识产权和敏感数据交由第三方服务存在安全和合规风险。通过本地部署模式,Instinct Coder 可让企业保持对数据和代码的控制,同时提供更可预测的基础设施成本。该平台支持 Claude Code、OpenAI Codex、Visual Studio Code 和 Cursor 等开发工具,每个节点最多支持 50 名用户(30 名并发用户)。此外,Spectro Cloud 提供的 PaletteAI Inference Launchpad 可实现 AI 工作负载管理、模型路由、请求审计和成本监控,并支持在需要时调用 Anthropic、OpenAI、Google 或 xAI 等外部模型。AMD 表示,Instinct Coder 旨在帮助企业摆脱高昂云端 AI 服务成本,在保障数据安全和自主控制的同时,加速 AI 驱动的软件开发流程。
“白毛股神”Serenity 发文表示,尽管 UBS 报告中的部分观察具有轶事层面的真实性,但更值得关注的是,关于 Anthropic 模型被蒸馏的相关中文报告正在增多。目前不少美国初创公司与科技企业在 AI 应用中,倾向使用更便宜的中国模型(如 DeepSeek),原因在于其单位任务成本显著低于 Gemini、OpenAI 及 Anthropic 等推理模型。Serenity 认为,这种趋势在资本主义驱动下形成“典型悖论”——企业天然会选择更低成本方案,从而削弱美国模型的领先优势,同时提出美国需要在两方面发力应对:一是构建更强的访问控制与认证体系,例如面向美国本土的“重 KYC 前沿模型”,以及针对盟友的分级访问机制,以降低模型被蒸馏与滥用风险;同时可引入类似“AI 版银行级认证”的身份验证体系(如生物识别+短时权限令牌),提升模型调用门槛,并通过监管手段限制账号共享与访问转售。二是提升推理模型的成本效率,使其在价格与性能上全面压制 DeepSeek 等竞争对手。Serenity 同时表示,当前一些高端模型频繁被“蒸馏利用”,理想情况下应对接近 AGI 级别的模型访问,增加更多摩擦成本。总结来看,美国 AI 产业的核心挑战在于:既要实现“低成本推理能力”,也要建立类似金融体系级别的模型访问安全机制。
知情人士称,英伟达开始向中国客户推销其首款独立中央处理器(CPU)产品 Vera。该芯片专为 Agentic AI(自主智能体)系统设计,目前已进入量产阶段,标志着英伟达正尝试通过 CPU 产品进一步拓展中国市场。消息人士称,部分中国客户已对 Vera 表现出兴趣。其中一家大型中国云计算公司计划采购 300 余台搭载双 Vera CPU 的服务器进行测试,并将在测试完成后决定是否扩大采购规模。Vera 基于 Arm Holdings 架构打造,是英伟达首次推出的独立 CPU 产品。英伟达此前表示,Vera 在 AI 智能体相关计算任务中的性能可达到竞争对手同类产品的 1.8 倍,并预计该产品将在本财年结束前(截至明年 1 月底)贡献约 200 亿美元收入。报道指出,随着 AI 行业重心逐步从模型训练转向推理计算(Inference),CPU 与定制芯片正获得更多关注。Vera 也使英伟达直接与长期主导服务器 CPU 市场的 Intel 和 Advanced Micro Devices(AMD)展开竞争。知情人士表示,由于美国对高端 GPU 出口实施严格限制,相较于 GPU 产品,CPU 在中国市场面临的监管障碍相对较小。目前部分中国客户计划先在海外数据中心部署 Vera 芯片进行测试。与此同时,软件生态兼容性以及现有国产 AI 芯片部署体系,仍可能影响 Vera 后续的大规模采用。(Reuters)
据潮向研究,巴克莱 8月 31 日研报指出,Hot Chips 2026 大会核心主题已从“谁算力最强”转向“谁能用最少电做最多事”,token/watt 成为衡量 AI 硬件成功的最关键指标。数据中心电力供应受限,硬件供应商和超大规模厂商均在固定功率预算下追求系统性能极限。推理工作负载分区成为关键架构分歧,英伟达与 Cerebras 采用预填充和解码分离的分区方案,可在 token/千瓦指标上带来约一个数量级提升;OpenAI Jalapeno 则将预填充、推测生成和解码全部集成于同一芯片。巴克莱预计两种方案将长期共存,分区方案可能随时间占据更大份额。
SemiAnalysis 在 X 平台发文表示,AMD 中层管理人员正耗费 20 多名工程师的时间,试图通过一个名为“ATOM Inference Engine”的无实际用途的副项目扩大自身势力范围并获得晋升,而不是将相关资源投入实际客户 Meta 和 xAI 正在使用的推理引擎,例如 SGLang 和 vLLM。SemiAnalysis 表示,包括首席工程师和 AMD Fellow 在内的数十名 AMD 工程师曾私下联系该机构,称由于 AMD 内部的办公室政治以及部分中层管理人员的支持,他们无法在内部讨论相关担忧。中层管理人员耗费 20 多名全职工程师的时间开发这一几乎没有客户的副项目,而参与该项目的工程师均为“10x 工程师”,本应投入 vLLM 和 SGLang 等客户推理引擎的开发工作。SemiAnalysis 称,中层管理人员将试图以唯一一个在生产环境中使用该项目的客户作为回应,即基于 Qwen 的阿里巴巴,但进一步调查显示,这只是阿里巴巴企业业务部门在有限范围内部署 ATOM,并非 Qwen 的主要业务部门。SemiAnalysis 表示,AMD 管理层将资源以及有限的内部 GPU 研发集群从支持 vLLM 和 SGLang 等生产环境推理引擎的工程师处调走,转而用于扩大自身势力范围和进行办公室政治,这对 AMD 工程师极不尊重。
Anthropic 本周对 Claude 进行升级,为 Claude Managed Agents 推出四项重要更新,进一步增强企业级 AI Agent 的可控性、部署灵活性和任务执行能力,包括:1、新增会话预算控制功能,用户现在可以为 Agent 会话设置预算上限,以实现更精准的成本管理。当会话达到预算限制后,系统将触发事件并暂停运行,用户可提高预算后恢复任务执行。2、开放推理区域控制能力,用户可以选择 Claude Managed Agents 运行位置,在全球可用资源中调度运行并按照标准价格计费,如果限制在美国区域运行,满足区域部署需求,但费用为标准价格的 1.1 倍。3、支持自动加载用户仓库中的 Skills 能力模块;4、新增顾问模型功能。用户可以配置一个更强大的模型作为“顾问”,让执行任务的 Agent 在会话过程中调用顾问模型进行第二意见分析,提高复杂任务处理质量。
半导体巨头 AMD 宣布推出企业级 AI 编程平台 AMD Instinct Coder,该平台结合 AMD 芯片、Supermicro 服务器及 Spectro Cloud 软件,旨在帮助企业在本地部署 AI 编码助手,降低云端 AI 模型使用成本并保护代码及数据安全。AMD 表示,Instinct Coder 是一套“开箱即用”的端到端 AI 开发平台,整合了 AMD EPYC 处理器、AMD Instinct GPU、Supermicro AI 服务器、Spectro Cloud PaletteAI Inference Launchpad 软件,以及经过 AMD 优化的 GLM-5.2 模型,可用于代码生成、应用现代化、自动化测试、代码审查等软件开发场景。AMD 称,与依赖云端前沿 AI 模型相比,Instinct Coder 可帮助企业降低最高 70%的总拥有成本(TCO),投资回收期最快可缩短至 6 个月。AMD 表示,越来越多企业希望利用 AI 提升开发效率,但同时面临两大挑战:一方面,调用顶级云端模型成本不断增加;另一方面,将企业源代码、知识产权和敏感数据交由第三方服务存在安全和合规风险。通过本地部署模式,Instinct Coder 可让企业保持对数据和代码的控制,同时提供更可预测的基础设施成本。该平台支持 Claude Code、OpenAI Codex、Visual Studio Code 和 Cursor 等开发工具,每个节点最多支持 50 名用户(30 名并发用户)。此外,Spectro Cloud 提供的 PaletteAI Inference Launchpad 可实现 AI 工作负载管理、模型路由、请求审计和成本监控,并支持在需要时调用 Anthropic、OpenAI、Google 或 xAI 等外部模型。AMD 表示,Instinct Coder 旨在帮助企业摆脱高昂云端 AI 服务成本,在保障数据安全和自主控制的同时,加速 AI 驱动的软件开发流程。
AI 推理云初创公司 General Compute 从 Upper90 取得 4 亿美元贷款,该笔交易为全球首例以推理专用芯片作为抵押品的融资项目。公司基于 SambaNova 自研 ASIC 芯片搭建专属 AI 推理云平台,主打 Agent 类 AI 算力负载,相较传统 GPU 云拥有更快令牌处理速度和更低运行延迟;硬件可直接部署在传统数据中心与闲置加密矿场设施。(mezha.net)
据路透社报道,Meta 计划自 9 月起量产自研数据中心 AI 芯片“Iris”,作为其 Meta Training and Inference Accelerators 四代项目的一部分,以提升 Facebook和 Instagram 等平台 AI 能力并降低对 Nvidia、AMD 等外部 GPU 依赖。内部备忘录显示,Iris 仅用 6 周完成测试,无重大缺陷;Meta 计划今年部署 7 吉瓦算力,并在 2027 年增至 14 吉瓦,2024年 AI 基础设施支出最高或达 1450 亿美元。为保障扩张,公司已与三星电子、Sandisk 和住友电工签署长期供应协议,应对内存与 AI 芯片“涨价”与短缺。
据潮向研究,摩根士丹利 2026年 9月 4 日研报指出,超大规模厂商数据中心资本开支 2027 年将达 1.5 万亿美元,同比增长 60%,2028 年增速骤降至 12%。AI 算力总容量将从 2025 年的 35 吉瓦增长至 2028 年的 145 吉瓦,增长 4 倍。定制芯片在增量容量中占比从 34%升至 66%,谷歌 TPU 和亚马逊 Trainium 主导这一转变。GenAI 投资回报率在 25%至 50%之间,模型层在自有基础设施上运行 API 回报最高(约 46%)。约 25%的标普 500 公司已量化 GenAI 收益,高于一年前的 14%。
据潮向研究,摩根大通 9月 2 日英伟达投资者会议纪要指出,英伟达对 FY28 年同比增长 70%的指引“感到舒适”,且该指引为供给受限而非需求受限,若供给充足业务可增长一倍以上。推理已成为数据中心业务中占比最大且仍在扩大的部分,18 个月前推理与训练大致各占一半,目前推理占比已超训练且将持续上升。先进晶圆与内存是两大供给瓶颈,英伟达与台积电及三大内存供应商保持深度合作。 客户结构持续拓宽,OpenAI和 Anthropic 目前约占终端需求 20%,FY28 或接近 25%;新创云厂商在 AI 计算基础设施中占比已超 50%。开源与闭源模型将共存,模型开发商毛利率正在改善。英伟达通过收入分成、PORTS-Pike 园区及 5000 亿美元私人资本融资平台支撑远期需求。小摩维持增持评级,目标价 320 美元,基于约 20倍 CY2026 预期每股收益 15.87 美元。
据潮向研究,巴克莱 8月 31 日研报指出,Hot Chips 2026 大会核心主题已从“谁算力最强”转向“谁能用最少电做最多事”,token/watt 成为衡量 AI 硬件成功的最关键指标。数据中心电力供应受限,硬件供应商和超大规模厂商均在固定功率预算下追求系统性能极限。推理工作负载分区成为关键架构分歧,英伟达与 Cerebras 采用预填充和解码分离的分区方案,可在 token/千瓦指标上带来约一个数量级提升;OpenAI Jalapeno 则将预填充、推测生成和解码全部集成于同一芯片。巴克莱预计两种方案将长期共存,分区方案可能随时间占据更大份额。
SemiAnalysis 在 X 平台发文表示,AMD 中层管理人员正耗费 20 多名工程师的时间,试图通过一个名为“ATOM Inference Engine”的无实际用途的副项目扩大自身势力范围并获得晋升,而不是将相关资源投入实际客户 Meta 和 xAI 正在使用的推理引擎,例如 SGLang 和 vLLM。SemiAnalysis 表示,包括首席工程师和 AMD Fellow 在内的数十名 AMD 工程师曾私下联系该机构,称由于 AMD 内部的办公室政治以及部分中层管理人员的支持,他们无法在内部讨论相关担忧。中层管理人员耗费 20 多名全职工程师的时间开发这一几乎没有客户的副项目,而参与该项目的工程师均为“10x 工程师”,本应投入 vLLM 和 SGLang 等客户推理引擎的开发工作。SemiAnalysis 称,中层管理人员将试图以唯一一个在生产环境中使用该项目的客户作为回应,即基于 Qwen 的阿里巴巴,但进一步调查显示,这只是阿里巴巴企业业务部门在有限范围内部署 ATOM,并非 Qwen 的主要业务部门。SemiAnalysis 表示,AMD 管理层将资源以及有限的内部 GPU 研发集群从支持 vLLM 和 SGLang 等生产环境推理引擎的工程师处调走,转而用于扩大自身势力范围和进行办公室政治,这对 AMD 工程师极不尊重。
OpenAI 公布其首款定制推理芯片 Jalapeño 的初步测试结果。数据显示,该芯片在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 等模型上,相较对比系统实现 1.5 至 1.9 倍 的峰值每瓦性能提升,并将端到端延迟降低 1.7 至 3.6 倍;在高交互负载下,性能提升达 2.1 至 4.1 倍。
据潮向研究,摩根士丹利 8月 Q2 业绩报告指出,CoreWeave 单季新增净活跃电力 500MW,超过历史上任何一个季度,同比超过上年同期的三倍,管理层重申 2030 年前至少达到 8GW 目标。FY26 营收指引中值上调 2%至 124 亿到 132 亿美元,ARR 中值上调 3%至 185 亿到 195 亿美元。公司上调全年资本开支指引中值 12%至 355 亿到 390 亿美元,Q3 资本开支指引 115 亿到 135 亿美元,高于市场预期的 100 亿美元。Managed Inference 平台(托管推理平台)ARR 从100 万美元增长至超过 1 亿美元,预计年底至少达 2.5 亿美元。 研报判断,Q2 调整后营业利润率约 8%高于预期,但 Q3 利润率指引 5.8%到 7.2%低于市场预期,Q4 利润率需大幅提升才能实现全年指引。大摩预计 CoreWeave FY27 运营利润率 15.9%、FY28为 22.4%,自由现金流至 2028 年仍为负,债务预计 2026 年底增至约 380 亿美元。大摩维持 Equal-weight(与大盘持平)评级和 99 美元目标价