成本效益也是关键因素。神威太湖之光作为大国重器,建造和维护成本天文数字,且能耗惊人,甚至一年的用电量堪比一座城市。阿里云通过分布式部署廉价通用服务器,利用软件定义的方式实现资源弹性伸缩,以最低的成本实现最高的性价比。拿超算做服务器,就像用兰博基尼去跑网约车,不仅贵,还完全不实用。
为什么阿里云不采用神威太湖之光超算作为服务器?
阿里云的核心竞争力在于其自主研发的飞天操作系统和神龙架构。通过虚拟化技术将算力池化,实现计算与存储、网络的解耦,能够应对流量洪峰而不崩溃。神威太湖之光虽然算力强大,但它是紧密耦合的系统,不适合分散在全球各地的业务需求。强行结合不仅无法发挥超算优势,反而会因为网络延迟和资源调度问题导致整体效率低下。
从硬件架构来看,神威太湖之光使用的是自主指令集架构,程序编译和开发门槛极高,普通开发者难以上手。而阿里云基于成熟的x86架构,生态丰富,易于部署大规模通用服务。对于商业公司而言,维护一个拥有庞大开发者社区的生态比使用封闭的超算系统要划算得多,也灵活得多。
阿里云和神威太湖之光的定位完全不同。阿里云主要处理海量数据的并发请求,比如双十一期间全球用户同时访问,需要的是高吞吐量和快速响应;而神威太湖之光是国家级超算,专注于极端复杂、高精度的科学计算,比如气候模拟或核试验仿真。一个是面向互联网业务的分布式集群,一个是面向科研的单节点极限算力,两者赛道不同。
超算的设计目标是追求极致的浮点运算速度,也就是所谓的PetaFLOPS,它通过堆砌大量专用处理器来攻克单批次巨大的计算任务。阿里云则更关注PUE(电源使用效率)和单位电量的计算产出,它面对的是上亿次独立的IO密集型任务。就像一台能吊起1000吨货物的巨型吊车,和成千上万台灵活穿梭的快递机器人,应用场景完全无法混用。