AI芯片公司Cerebras Systems近日推出全新机架式AI系统CS-4,直接对标英伟达的GPU服务器产品,瞄准大模型推理市场。据该公司宣称,在整机资源全部供给单一用户的场景下,CS-4每秒生成token的能力可达传统GPU服务器的30倍。
值得注意的是,该数据基于Cerebras内部测试结果,衡量的是单用户独占整机算力时的文本生成速度,而非系统同时服务多个用户的总吞吐性能。
Cerebras在旧金山举办的活动上介绍,CS-4系统内置3颗WSE-3 Turbo晶圆级处理器。公司表示,该处理器集成约4万亿个晶体管,是迄今为止公开报道中规模最大的AI处理器之一。与英伟达、AMD普遍采用的多芯片拼接方案不同,Cerebras处理器为单片完整晶圆设计,芯片内数据传输路径更短。
CS-4系统面向AI推理场景而非模型训练。在存储架构上,该系统采用静态随机存取存储器(SRAM),而非行业常用的动态随机存取存储器(DRAM)。SRAM的读写速度显著优于DRAM,但其结构复杂、单位成本更高,通常难以在面积有限的处理器中部署。Cerebras的WSE-3 Turbo晶圆处理器尺寸较大(约相当于一个餐盘大小),为片上集成SRAM提供了物理空间。
Cerebras将快速文本生成能力作为其竞争核心。公司方面表示,其晶圆级芯片可直接存储AI模型所需的全部参数数值,无需通过外部链路访问存储芯片调取数据,从而避免了因数据搬运造成的延迟损耗。
据Cerebras介绍,CS-4系统目前已向少量客户提供样品,计划于今年第三季度晚些时候扩大供货范围。
资讯分类:
相关文章
相关报告