跳到正文

Startup Gimlet Labs 巧妙解决 AI 推理瓶颈问题

Gimlet Labs 获得 8000 万美元 A 轮融资,用于推广其“多硅推理云”技术。该技术通过软件将 AI 工作负载同时分配到 CPU、GPU 和高内存系统等不同硬件上,以提高效率、降低成本。

功思 AI 编辑部

约 2 分钟读完

Startup Gimlet Labs 巧妙解决 AI 推理瓶颈问题

导语

斯坦福大学的兼职教授、成功创业者 Zain Asgar 刚刚为一家公司筹集了 8000 万美元的 A 轮融资,该公司以一种巧妙的方式解决了 AI 推理瓶颈问题。本轮融资由 Menlo Ventures 领投。

这家名为 Gimlet Labs 的公司,创建了其声称是首个也是唯一一个“多硅推理云”。这是一款软件,允许 AI 工作负载同时跨越不同类型的硬件运行。它可以将 AI 应用的工作分配给传统的 CPU、AI 优化的 GPU,以及高内存系统。

“我们基本上可以在任何可用的不同硬件上运行,”Asgar 告诉 TechCrunch。

核心信息

Menlo 的首席投资人 Tim Tully 在一篇关于此次融资的博客文章中写道:“一个独立的代理可能需要链式执行多个步骤,而每个步骤‘需要不同的硬件:推理是计算密集型的;解码是内存密集型的;工具调用是网络密集型的。’”

Tully 认为,虽然目前还没有一个芯片能做到这一切,但随着新硬件的推出和老旧 GPU 的重新部署,“多硅舰队已经就绪——它只是缺少使其能够工作的软件层。” 这正是 Gimlet Labs 所提供的。

如果当前的“增加计算部署”趋势持续下去,McKinsey 估计到 2030 年数据中心的支出将接近 7 万亿美元。Asgar 表示,目前的应用仅使用了已部署硬件的“大约 15% 到 30%”的时间。

更多细节

“换个角度思考:你因为闲置资源而浪费了数千亿美元,”他说。“我们的目标基本上是找出如何让 AI 工作负载比以往任何时候都提高 10 倍的效率。”

因此,他和他的联合创始人 Michelle Nguyen、Omid Azizi 和 Natalie Serrino 着手构建了编排软件,该软件能够切分代理工作负载,使其能够同时分散到各种硬件上。

Gimlet Labs 声称,在相同的成本和功耗下,其 AI 推理速度可靠地提高了 3 倍到 10 倍。Gimlet 表示,它甚至可以将底层模型进行切分,使其跨不同架构运行,并为模型的每个部分使用最合适的芯片。

影响与观察

该公司已经与芯片制造商 NVIDIA、AMD、Intel、ARM、Cerebras 和 d-Matrix 达成了合作。

参与讨论

正在确认登录状态…