博通,怎么看?

已往两年,人工智能的繁荣让英伟达走向了风口浪尖,但实在藏在英伟达背后,另有一家芯片公司在快速发展,那就是博通。数据显示,已往一年,博通公司股价已经上涨一倍多,博通也成为了英伟达之后,为数不多能跃进全球前十的半导体公司之一。

上个星期,Broadcom 在其位于圣何塞的工厂举行了有史以来的首次投资者日流动,Broadcom 拥有 26 个部门或损益表,其中 17 个属于半导体团体。半导体团体的收入约为 300 亿美元,并以两位数的速率增进。该团体每年的研发用度为 30 亿美元。

Broadcom 半导体解决方案团体总裁 Charlie Kawwas 介入了此次演讲,这次投资者日流动旨在让投资界领会 Broadcom 的怪异市场战略。在本文中,我们总结了博通对AI市场的看法。

博通所提供的半导体解决方案

Charlie Kawwas首先提到了Broadcom的传统基因就是手艺创新,在已往八年里,Broadcom没有收购过一家半导体公司,却实现了有机增进,2019 年的营业规模为 170 亿美元,而2023年的营业收入到达 280 亿美元,年均复合增进率约为 13%,比半导体行业快得多。其示意,这一切都确立在大规模投资的基础上,Broadcom在这一营业上的研发投资跨越 30 亿美元。在已往的五年中,共有 150 亿美元的研发投入,这些资金支持了有机增进。

Kawwas称,Broadcom实现有机增进,靠的是三大支柱。*大支柱是市场。在实行战略时,选择持久的市场,并对这些市场举行长达 10 年的考察。Broadcom问自己的*个问题是,10 年后这个市场还会存在吗?在人工智能领域,Broadcom已经投资了近十年,只是恰巧遇到了一个正在大幅增进的市场,Broadcom很喜悦能成为其中的一员。

而第二大支柱,也是最主要的支柱,是手艺,这是 Broadcom 的传统和基因,尤要做到这一点,就必须举行投资和研发投资,必须确立一支工程师图团队,正是这些工程师为Broadcom带来了*职位,带来了Broadcom今天要与人人分享的手艺。

第三大支柱是执行,当Broadcom在市场上打拼了 10 年,并在这段时间内带来了*的手艺,最终在每个种别中都成为*,Kawwas示意,基于以上三点,Broadcom缔造了一个术语,叫做 “可连续特许谋划”,这也是每个营业单元或部门的焦点界说。

Kawwas提到,Broadcom将重点关注网络中的细分市场,即人工智能以及若何在基础设施中启用人工智能。*个支柱市场现实上是由两个差其余市场组成。一个是消费人工智能领域,该领域的介入者寥若晨星,但却拥有数十亿用户,他们赚钱的方式是基于广告、最终用户和消费者的介入,介入度与他们在人工智能和机械学习方面的投资额直接相关,他们确立的集群越大,介入度就越高,这意味着更好的经济回报。

另一个市场则是企业,它可以是云盘算或内部部署。在该领域中,许多人都在实验投资人工智能,但商业案例另有待验证,每小我私人都在确立小型集群来试验这些手艺,甚至云盘算公司也在举行一些试验,但并没有像消费级人工智能那样,泛起真正切实的商业案例。

在手艺这第二个支柱中,从Broadcom的角度来看,会专注于两种产物。一个是我们所说的人工智能加速器即XPU,开发这部门产物现实上有两种方式,厂商可以开发一种知足所有人需求的通用产物,但它们功耗过大,且过于昂贵,无法现实部署到网络中。其中一部门公司别无选择,由于他们不具备定制能力,但少数拥有数十亿用户规模、缔造数千亿甚至跨越 5 万亿美元收入的公司具备这种能力,这也是Broadcom将其命名为定制 XPU 或定制 AI 加速器的缘故原由。

Kawwas示意,在这一切的基础上,还要将这些 XPU 毗邻起来,厂商需要一种网络手艺某人工智能毗邻手艺,而Broadcom将讨论消费级人工智能的大规模建设,从产物和手艺的角度来看,Broadcom将重点先容定制的人工智能加速器,并最终向人人展示Broadcom的整小我私人工智能毗邻产物组合。

他提到,Broadcom并不是在最近一两年才最先关注人工智能的,在 2022 年之前的很长一段时间里,人工智能在半导体领域的收入一直低于 5%,但近两年它们在半导体领域的收入跃升了 2 倍多,到达了 10%。2023 年Broadcom在该市场拿下了15%的份额,预计2024年能到达25%的份额,总收入跨越100亿美元。

值得一提的是,Kawwas在本次流动中宣布了Broadcom的第三家定制芯片大客户。

*位客户毫无疑问是是谷歌,从*代TPU最先,十年来谷歌一直是 Broadcom 的定制芯片客户,而Kawwas还提到了新加入的第二家定制客户,也许率就是 Meta,其在已往四年来一直是Broadcom的客户,它们互助构建了多代产物,现在以及实现量产。

Kawwas所宣布的第三位客户众说纷纭,有外洋媒体预测可能是海内的字节跳动,理由是它拥有大型网络,并接纳了 Broadcom 的片上神经网络推理引擎,同时也是一个以消费者为导向的大型社交网络,可以通过使用更多的定制芯片而不是商业芯片来获得快速的投资回报。

Kawwas回忆到两年前,那时的集群拥有*进的 4,096 个 XPU,单个XPU功率为几百瓦,与现在相比,使用战斧(Tomahawk)交流机将 4000 个 XPU 互联是相当简朴的单层网络。而在2023 年,Broadcom确立了一个使用这种 XPU 的集群并最先出货,该集群的 XPU 节点跨越 10,000 个,需要两层战斧或Jericho交流机才气实现这一目的,他示意,这是现在业界功耗*的 XPU,无论是商用照样定制,功耗都低于 600 瓦,并接纳了*。

Kawwas示意,随着 2024 年的到来,Broadcom设计将这一集群扩展到 30,000 个XPU以上,尔后,Broadcom的消费级人工智能客户的设计和目的是,若何将这一数字提高到几十万甚至上百万,这也是Broadcom正在起劲的偏向。

随后Kawwas展示了最新的XPU,可以看到中央的两个盘算单元和左右双方的所有 HBM。一个完整的定制 SoC,其拥有强悍的算力、大容量的HBM与高速芯片内毗邻,以及最高性能的外部网络,对照有意思的是,这款XPU一共拥有12个HBM客栈,作为对比,英伟达的Blackwell仅有8个HBM客栈,Kawwas强调,Broadcom所定制的XPU在HBM上比对手多出了整整50%,Broadcom可以比其他任何人做得更好、更快、更省电。

随后Kawwas分享了若何构建一个集群,从单个XPU到一台服务器,再到一整个集群。他示意,现在业界功耗*的 XPU 就是Broadcom的产物,功率为 600 瓦,其他公司即将推出的下一款产物可能在 1,000 瓦左右。若是今年要生产 3 万个这样的产物,仅 XPU 就需要 30 兆瓦的功率,这就是大多数数据中央允许的*功率,这还没算上电源、冷却系统和网络,他强召集群就是一个异构系统,需要在生态系统的多个介入者之间找到一种扩展方式,天下上没有一家公司能在数据中央或集群中构建一切,人人需要相互互助。

为领会决这些问题,Broadcom正在举行三方面的手艺投资。其一,Broadcom以为行业的这一主要拐点必须是开放的,必须由以太网、PCIe 等开放尺度以及内存层面的其他尺度功效来推动。

第二个方面是规模,若何扩展到百万级集群?这些架构中最主要的并不仅仅是 XPU,Broadcom的愿景和前进的方式都以网络为中央,当XPU数目跨越1万、2万和3万时,这将成为一个漫衍式盘算的挑战,再好的网络架构也无法解决漫衍式盘算的难题,Broadcom会在扩大和扩展这些网络并实现网络互联方面做出答应。

最后一方面就是节能手艺,为了做到这一点,Broadcom最先了研发,并以可连续的方式提供这些手艺。他示意,焦点交流团体总司理Ram Velaga 会先容人工智能网络,数据中央解决方案团体总司理Jas Tremblay 会先容服务器互连,光学系统部门总司理Near Margalit 会先容光互连,物理层产物部门总司理Vijay Janapaty 会先容跨 P&L 共享的 SerDes 等基础手艺, ASIC 产物部总司理Frank Ostojic 会先容定制人工智能加速器。

人工智能网络

Ram Velaga示意,当需要一百万个以上的 GPU这种规模时,毗邻它的*方式就是拥有网络,也印证了一句老话:网络就是一台盘算机。

他提到,为了让交流机获得 GPU 和交流机之间的流量,用户需要 NIC。GPU 需要大量带宽,而 NIC 必须跟上即将泛起的 GPU 带宽量。Broadcom的重点是具有异常高 RDMA 性能的NIC,可以连续从 400 GB 扩展到 800 GB,再到 1.6 太比特。

史上最难喝的饮料,一股风油精味,却年销上亿

史上最难喝的饮料,一股风油精味,却年销上亿,亚洲沙示,在广东人心目中比可乐分量还重的饮料,年销量上亿瓶。

RDMA 约莫泛起在 25 年前,那时的想法是两个 CPU 想要相互通讯并共享内存。因此,它是为两台机械相互通讯而构建的,然后逐步地从 2 台扩展到 16 台、32、64、128、512。但它从来不是为数千或数十万个 CPU 或 GPU 相互通讯而构建的,RDMA 中现实上存在许多问题。Broadcom现实上对 RDMA 举行了重大增强,以便它可以扩展到跨越 100 万个集群。

Ram Velaga讲到,在这个天下上,不会有数以百万计的 GPU,也不会只有一种大型机解决方案在销售。在历史上,这种情形的*出路就是拥有多个供应商和多种解决方案。当你拥有多个供应商和多个解决方案时,你需要的是一个能将所有这些解决方案互联在一起的结构,这是一个漫衍式盘算问题。仅仅说我能制造*的 GPU 并不能解决问题。你需要构建能够扩展的 GPU,并能在一个异常异常大的结构中联网,以太网就是这个结构,未来也会是这个结构。

Broadcom不仅信托以太网,还信托以太网现实上是基于一个异常开放的生态系统。Broadcom做的是,自己有芯片和一大堆供应商,他们在天下各地制造硬件,另有一大批互助同伴,他们在硬件之上构建软件,并提供所有的治理和其他服务。这就是Broadcom要接纳的方式。打造*的网络装备,将其提供应一个异常异常普遍的生态系统,并坚信这是一个漫衍式盘算问题,而要大规模解决这个问题的*方式就是不制作大型机。

服务器互连

Jas Tremblay示意,客户现实上需要在人工智能服务器内构建一个网络,为此选择的网络是 PCIe。它的延迟异常低、无处不在、基于尺度,而且允许公司将他们需要的各个部门整合在一起。事实上,人工智能服务器内部拥有开放的内部结构是自由的要害,这样客户就可以选择想要的组件。若是客户作为云提供商在内部构建自己的 NIC,若是您想使用差异类型的加速器,那么拥有开放结构可以让您挑选所需的组件,并构建更适合的 AI 服务器您的需求。另一个因素是,若是是服务器 OEM 或 ODM,则很难为每种类型的加速器构建完整的系统。因此,客户希望拥有一个可以在 AI 服务器内支持商业、定制和差异类型 XPU 的架构。因此,使用 PCIe 交流作为这些 AI 服务器内部的内部网络异常主要。

这个网络需要超低延迟,需要高带宽,但最主要的是,它需要被信托。它需要中止许多许多类型的装备。它需要相符尺度。它需要具有先进的遥测和诊断功效。因此,若是要在网络中部署数以万计的人工智能服务器,则需要在网络内部、人工智能服务器内部拥有告诉您正在发生的情形的功效,因此Broadcom投资了性能、*功耗以及先进的遥测和诊断。

其中,交流机是该网络的焦点元件。在已往 20 年里,Broadcom一直是*个推出适用于每一代 PCIe 的 PCIe 交流机的公司。现在Broadcom正在批量发货 PCIe Gen5 交流机,为整个行业、定制和商业加速器中的绝大多数 AI 服务器提供动力,且Broadcom即将推出第五代 5 纳米重准时器,还将在今年年底提供 PCIe Gen 6 交流机样品。

此外,Broadcom正在与AMD互助构建一个扩展解决方案,博通将构建交流机,AMD 将构建加速器,其将以开放的方式通力互助,将其提交给尺度机构,未来会提供一种开放、低功耗、高性能、低延迟的方式来毗邻 CPU、NIC、NVMe 驱动器和 XPU。

光互连

Near Margalit示意,人工智能系统正在不停消耗整个系统越来越多的带宽。因此需要光学手艺来支持这一点,包罗扩展和成本,以及能够提供更高级其余带宽。

他讨论了Broadcom拥有的三项焦点手艺。*个是垂直腔面发射激光器。这是整个行业人工智能手艺的主力。它可用于以太网、InfiniBand 和 V-Link 手艺。由于多模光纤自己的缘故原由,它在距离上确实有限制,限制在 100 米左右,但它的功耗异常低,成本也很低,而且在当今天下上大多数人工智能系统中获得了普遍部署。

第二项手艺是配合封装光学器件,它是直接集成在 ASIC 上的高速硅光子学的集成,无论是交流机、整个系统中的 PCI 交流机或加速器都为这些下一代系统提供了功耗和成本*优势。Broadcom此前宣布了有关 VCSEL 和 EML 手艺的新闻稿,其已交付了跨越 2000 万个每通道 100 gig 手艺的通道,真正展示了我们光学手艺的焦点向导职位。

Near Margalit注释了为什么要举行配合封装,对于这些人工智能系统来说,带宽、组件数目不停增添,而光学器件的成本仍然是可扩展性方面的一个问题。那么,若何制订蹊径图,继续降低光学成本,以顺应越来越大的集群和 GPU?Broadcom的解决方案是集成,稀奇是在硅光子学中追求集成,以便能够将越来越多的组件直接集成到单个芯片上,其信托在光学领域这也是准确的方式,以为 CPL将继续提供单元比特成本*的能力。

配合封装光学器件的第二个利益是,现实的光学器件就在信号所在的位置。因此可以脱节 ASIC 和光学器件之间庞大的电气通道,现在市场上典型的 800 gig 可插拔收发器功率为 14 瓦,展示的贝利系统现在的功耗为 5 瓦,与现在的典型部署相比,可以节约 70% 的功耗。

Near Margalit示意,耐久以来,Broadcom在光学元件方面展现了行业*职位,稀奇是现在每通道100 gig 这方面。此外,Broadcom在交付人工智能应用方面做得异常好,已经展示了继续将 VCSEL 手艺和 EML 手艺扩展到 200 gig 的能力,还在追求扩大规模。同时Broadcom还推出了*个带有可插拔激光器的配合封装光学器件的商业系统,可同时提供成本和功耗优势,功耗降低70%,成本节约30%。

跨 P&L 共享的 SerDes

Vijay Janapaty示意,在集群市场中,链路的带宽现实上每两年就会翻一番,是人工智能集群中第二大功率和成原本源,关注这些高速链路的功率和成本异常主要。若是把这些链路放在一起看,大部门链路都是铜缆,功耗*、成本*,然则传输距离约为 5 米左右,光学装备的笼罩局限更大,但功率最高,成本也最高。因此研究若何降低这些光学器件的功率和成本异常主要。

在铜缆链路上,Broadcom用来驱动这些铜缆链路的手艺是 SerDes。这些 SerDes 内核嵌入在战斧交流机、XPU 或网卡中。而Broadcom的目的是,若何确保尽可能多的链路使用铜缆?其次就是若何降低这些链路的成本和功耗。

他宣布了Broadcom的下一代 SerDes,内部的代号是 Condor。它基于 3 纳米而非 4 纳米制造,它具有异常多优势:超长传输距离、45 分贝、两米多长的 DAC 电缆,因此可以笼罩机架上的所有装备,无需任何重准时器,机架上也不需要有源装备。同样,它还具有 CPO、线性光学等相同的优点,Broadcom所有的产物团队现在都在使用它举行设计。依附所拥有的这些规格,Broadcom将再次成为 200 gig SerDes 领域的*。

定制人工智能加速器

Frank Ostojic示意,为什么消费级人工智能客户想要自己的芯片?他们为什么要与我们互助确立这些 XPU?为什么他们不能使用 GPU、第三方芯片?有什么利益?利益可以用一个简朴的等式来注释。性能除以总拥有成本。什么是总拥有成本?就是芯片的成本、电源的成本以及将其组合在一起的基础设施的成本。

当用户使用 XPU 时,若是是这些消费级人工智能公司中的一员,就会拥有一些对你的创收和应用异常主要的内部事情负载,若是你能定制你的架构或加速器、带宽以及加速带宽与 IO 的比率,你可能就能比使用通俗硬件更高效地完成你异常体贴的特定事情负载或异常特定的事情负载。

Broadcom会与客户互助,定制他们所拥有的架构,以确保他们能够*限度地提高他们所体贴的性能。当思量效率和优化时,另有另一个异常好的效果,会使它更小,更廉价,使用更少的空间。因此,当这些公司最先使用我们配合开发的设计时,他们就能节约数百万甚至数十亿美元的资源支出,由于这些设计完全相符他们的需求,内存和 AIO 的比例都恰到利益。

Broadcom提供的XPU为优化的事情负载提供*功耗、*性能,使我们能够以总体拥有成本(TCO)获得*性能,这就是Broadcom所专注的,博通能够提供包罗网络、架构、互联等一整套方案,知足差异客户的需求。

Frank Ostojic示意,Broadcom在定制芯片方面会捉住三个重点,*是专注,Broadcom想做好一件事,而且已经做了 10 年,就像30 年前在惠普公司创业时一样,做这种消费级 AI 高难度芯片,第二是投资,30 亿美元主要集中在人工智能领域,并优先思量人工智能。第三是履历,10 年的修补、学习错误、改善流程和用功的纪律,以使用相同的流程,另有三年或四年的投资,用于我们以为客户会需要的未来项目。

【本文由投资界互助同伴微信民众号:半导体行业考察授权宣布,本平台仅提供信息存储服务。】若有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处置。

原创文章,作者:APP软件开发,如若转载,请注明出处:https://www.yuanma666.com/archives/66162.html

(0)
APP软件开发APP软件开发
上一篇 2024年4月1日
下一篇 2024年4月1日