加载中...

Groq 是 2016 年由前 Google TPU 核心设计者 Jonathan Ross 创立的美国 AI 芯片公司,专注大模型推理加速,自研芯片称为 LPU(Language Processing Unit)。
LPU 采用确定性的张量流(tensor streaming)架构:没有传统 GPU 的动态调度与缓存层级,编译器在编译期精确安排每条指令与数据搬运的时序;片上使用大容量 SRAM 而非 HBM 作为主要权重存储,访存带宽极高且时延可预测,代价是单芯片容量有限,需要大量芯片组成流水线共同承载一个模型。
GroqCloud 提供 OpenAI 兼容 API,托管 Llama、Qwen 等开源模型,以每秒数百 token 级的生成速度和明确的低价策略吸引开发者,成为「快推理」赛道的代表。
Groq 与 Cerebras、SambaNova 等共同证明了推理专用架构挑战 GPU 的可行性。

登录 后参与讨论
暂无讨论,来发表第一条评论吧