英伟达开发者博客在 9 月 30 日宣布,cuObject 客户端和服务器库正式提供。开发者可以用 cuObject 的接口和 RDMA 线协议做加速的对象存储应用和服务器。页面顶部另有一段生成摘要,页脚写摘要可能不完整。下面只采用正文。

[1]
蚀刻版画:青色虚线从开口浅盘跃过合盖的盒子,落到小芯片上。
左边是一只开口的浅盘,中间一只合上盖的盒子,右边一块小芯片。青色虚线从浅盘跃过盒子,落到芯片上,没有进入盒子。对应对象数据不经过服务器 CPU。这是插画,不是架构图照片。, AI 生成插画,不是新闻照片

正文写,训练、微调、推理上下文、工具调用、搜索和数据库查询都更需要高速访问文件和对象,这些数据既在本地也在云上。GPU、TPU 和 XPU 需要远程直接内存访问,传输由网卡或数据处理单元加速,并且不把数据复制进服务器 CPU 控制的内存。以往做文件和对象的直接访问,要对付各家不同的接口和协议。对象存储走 RDMA 也缺少共同的线协议,开发者要么做厂商专用集成,要么退回传统访问。

cuObject 让加速器用 RDMA 访问文件和对象存储,数据不经过服务器 CPU。正文把这条路径写成更高吞吐、更低延迟、更低的 CPU 占用,没有给出测量数字。图注写,对象的控制协议走 HTTPS/TCP,对象数据传输走 RDMA。

[1]

英伟达正在把 xio-sig 从 cuFile 扩展到同时包含 cuObject,合作方写的是 Google Cloud 和微软。Google Cloud 已经是 xio-sig 里 cuFile 的维护者,目前正在评估是否把参与范围扩到 cuObject。微软则是期待加入 xio-sig 董事会,以改善存储 I/O 的互操作。博客用的是期待加入,不是已经入会。

xio-sig 的目标,是让 cuObject 客户端能够对接任何遵守该线协议的服务器实现。仓库结构已经按 cuFile 和 cuObject 分开。cuFile 与 cuObject 的头文件、cuObject 线协议,以及 libxFile 和 xFilekernel 的实现代码,要等可投产的软件栈通过一致性测试之后才会公开。治理文件仍在待定董事会成员审阅中。

[1]

同一篇还宣布 SCADA 服务器 SDK。存储厂商可以用它做 SCADA 服务器,响应 GPU 上的 SCADA 客户端发起的请求,用本地或远程存储完成,再经 RDMA 返回结果。IBM 展示了一个原型:SCADA 客户端把请求发给基于这个 SDK 的 Storage Scale SCADA 服务器初版。这是互操作原型,不是已经发售的产品。

在名为 Storage-Next 的安排下,英伟达带领一个超过 40 家厂商和客户的小组,成员包括 NAND 厂商、控制器厂商、存储厂商、超大规模云厂商和应用开发者,讨论 GPU 发起的存储应当怎样工作,并做成可互操作的公开行业标准。支撑高吞吐、细粒度、由 GPU 发起的存储访问的软件基础是 SCADA。页面给出了 cuObject Server 2.0.0 的链接。

[1]

要点

  • cuObject 客户端和服务器库已正式提供,接口和 RDMA 线协议用于对象存储,数据不经过服务器 CPU。
  • 控制面走 HTTPS/TCP,数据面走 RDMA。正文没有给出吞吐或延迟的测量数字。
  • Google Cloud 在评估是否扩大参与。微软是期待加入 xio-sig 董事会,不是已经加入。头文件和实现代码要等一致性测试通过才公开。
  • SCADA 服务器 SDK 供存储厂商响应 GPU 发起的请求。IBM 展示的是与 Storage Scale 的原型。Storage-Next 小组超过 40 家。