KCD Hangzhou + OpenInfra Days China 2025,云原生,人工智能,开源,大模型,KCD Hangzhou 2025 组委会,OpenInfra 中国用户组, 照片直播 | KCD HANGZHOU OPENINFRA DAYS CHINA 2025

image

谈谈几点收获

关于 MaaS

关于 Nydus

谈谈几点感想

  • 关于灵魂拷问「在 AI 推理的背景下,是否一定需要 K8s?」:

    • K8s 作为 GPU 资源统一纳管层的角色不会被替代,可以通过 Pod 作为 infra 和业务之间界限。Pod 之下,K8s 繁荣的生态可以免去操作系统层面很多不必要的运维工作;Pod 之上,业务需要自身来维护。那能不能把 AI infra 也纳入到 K8s 生态呢,享受 K8s 中例如 HPA 这样的功能?从我个人的角度来说,我觉得比较困难:

      1. 从常规角度思考,「模型」≠「镜像」,「模型 + vLLM 等运行框架」==「镜像」。从镜像开始,才有 Pod 的生命周期,K8s 才能对 Pod 进行管理。所以无法通过只更新模型完成 Pod 的更新。

      2. 如果我们把 vLLM 等框架理解成特殊「容器运行时」,在「容器运行时」中提供了 **UpdateContainerResources**** 来修改容器的资源,那么我们可以把「模型」想象成一种特定的资源来完成更新。但是 **UpdateContainerResources** 目前还是 beta 的状态,并且更新的流程也会牵涉到具体推理框架的实现,难度较大。**

  • 关于大厂:

    • 本次活动中分享的绝多数是大厂:在这轮生成式 AI 的大背景下,大厂相对会更加具有优势,有钱、有人才、有技术沉淀、有场景。

    • Kata 安全容器(针对高机密计算场景):国内大厂的部分团队研究的内容会更具前瞻性,绝大部分场景根本用不到,而这些场景普通团队碰不到。

    • 阿里百炼:MaaS 的生意是不赚钱的。如何做到成本最优化,很多情况下需要有足够大的使用量才有必要通过技术手段来优化成本,才会产生经济效益。至少通过百炼来看,公司财务对成本这块的控制还是比较强势的,从而倒逼技术做优化。

    • 阿里集团、蚂蚁、阿里百炼、通义实验室,在阿里系内部,其实也存在大量重叠的产品。就像蚂蚁有独立的 infra 团队,而不使用阿里云。MaaS 也有多个团队在做,只是有些对外,有些对内。

  • 冷启动做 MaaS 是非常不经济的,前期投入成本过高,后续技术更新迭代节奏也快,「AI 一天,人间一年」