导语

近期全球边缘计算服务商Cloudflare连续推出两项核心基础设施能力:面向边缘场景优化的Drop存储服务,以及基于新型共识算法的全球分布式共识协议Meerkat,引发了分布式系统和边缘计算领域的广泛关注。不同于此前Cloudflare推出的上层应用类功能,本次发布的两项能力均指向边缘计算生态的底层短板,标志着Cloudflare的技术竞争壁垒已经从节点规模延伸到核心基础软件领域。

事实综述

作为Cloudflare边缘生态的新存储产品,Drop专门针对边缘计算场景的低延迟访问需求设计,可与Cloudflare现有Workers、Pages、R2等服务无缝打通,为全球部署的边缘应用提供就近的存储访问能力,目前官方已经开放产品介绍页面,后续将逐步向开发者开放使用。

根据Cloudflare官方技术博客披露,此前Cloudflare全球330+数据中心的控制平面状态同步长期依赖Raft类共识算法,但这类基于leader的共识算法在广域网场景下存在明显短板:一旦leader节点出现故障或者网络连通性下降,系统需要等待超时后重新选举leader才能恢复写服务,而广域网的延迟波动大,超时参数很难适配全球多节点的复杂网络环境,Cloudflare内部已经多次因leader不可用引发生产故障。

为解决这一痛点,Cloudflare研发团队耗时1年打造了全新的分布式共识服务Meerkat,底层采用2023年EPFL研究团队发表的QuePaxa共识算法,和传统Raft算法最大的不同是,QuePaxa采用无主设计,所有副本节点均可随时处理写请求,系统不会因为单个节点故障或者超时而停止服务,完美适配Cloudflare全球广域网的运行环境。

据我们所知,这是QuePaxa算法首次在全球规模的工业场景落地。—— Cloudflare官方技术博客

目前Meerkat仍处于实验阶段,暂时仅对内用于控制平面的小体量状态管理,比如AI模型实例的部署位置信息、分布式数据库的leader选举信息等,具备线性一致性保障,只要集群中超过半数节点存活即可保持读写可用,最多可容忍接近半数节点的故障。

解读与评价

这两项发布的核心价值,在于直接击中了当前边缘计算大规模落地的两大核心痛点:第一是边缘存储的性能和生态兼容性问题,过去边缘应用的存储要么需要回源到中心云导致延迟升高,要么使用边缘本地存储无法实现全局数据同步,Drop的出现刚好填补了这一空白;第二是跨地域边缘节点的强一致状态同步问题,过去开发者要实现全球部署应用的强一致状态,要么自行搭建跨地域的分布式共识系统,要么牺牲一致性换可用性,Meerkat的落地为这一问题提供了成熟的工业级解决方案。

对中国开发者而言,这两项技术的参考价值远大于产品本身的使用价值:首先,对于分布式系统研发人员,QuePaxa算法的工业落地实践证明了无主共识算法在广域网场景下的可行性,比传统Raft算法更适合跨地域部署的分布式系统,可以直接借鉴其设计思路优化现有系统的可用性;其次,对于出海应用开发者,后续Cloudflare开放这两项能力后,无需自行搭建复杂的全球分布式存储和共识系统,即可快速搭建低延迟、强一致的全球应用,大幅降低出海的基础设施成本;最后,对于国内的边缘计算服务商,Cloudflare的技术路径明确了边缘计算的竞争已经从节点规模的比拼转向底层基础软件能力的比拼,补全边缘存储、跨节点共识等底层能力将成为下一阶段的核心竞争点。