机械荟萃山庄

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
热搜: 活动 交友 discuz
查看: 119|回复: 2

智算中心正在重走大炼钢铁的老路

[复制链接]

3万

主题

3万

帖子

23万

积分

超级版主

Rank: 8Rank: 8

积分
233209
发表于 6 天前 来自手机 | 显示全部楼层 |阅读模式
最近一两年,全国算力网、一体化算力调度、东数西算的概念铺天盖地。各地政府纷纷上马智算中心、算力平台、调度大屏,新闻通稿全是宏大叙事:全国调度、算力互通、盘活资源、数字底座。场面宏大、蓝图惊艳、投资额动辄数十亿。
如果你关注AI产业链,除了大模型、PCB、玻璃基板、MLCC之外肯定也听说过另一批很硬核的关键词:智算中心,百亿投资、几万PFLOPS、几百MW等等等等。
商汤科技6月17日宣布,要在香港建设超大型AI数据中心,目标是2030年前建成规模超40000P的智算中心。
中国移动董事长陈忠岳在6月24日表态,要“布局超大规模智算中心”,构建一体化的算力网络。
张家口的中明算力中心总投资200亿元、规划50000P,一期即将投运。
韶关的协鑫华南智算中心一期计划投资100亿元,规划建设8万个标准机柜。
甘肃庆阳的智算规模已突破15万PFLOPS,跻身全国第一梯队。
仿佛全国各地都在修建通往AI时代的诺亚方舟。张家口在建、甘肃在建、辽宁在建、河北在建……很多过去绝不会出现在科技新闻里的县城,也开始在招商引资的蓝图上,勾勒出属于自己的超大型算力基地。
看上去,一场壮丽的基础设施竞赛已经拉开大幕。

但无数业内人心里都藏着一个灵魂拷问:
这玩意儿,和十年前遍地开花的智慧城市、数字政府,到底有什么区别?
当年的智慧城市,也是同样的剧本:重金砸钱、搭建平台、炫酷大屏、全城数字化。最后落幕的结果是什么?一堆落灰的服务器、无人运维的系统、仅供视察的巨型显示屏,成了各地财政的无效负债。
如今换了个 "算力网" 的新马甲,轰轰烈烈重启新一轮基建。是产业真的升级了,还是又一场换汤不换药的政绩工程轮回?

信通院在《算力互联网》系列报告和科普中明确:服务器、芯片、机房不发生跨域位移;算力互联网通过标识、网络和编排,把任务及关联数据送到目标资源池执行,再返回结果。
信通院副院长王志勤的表述更直白:"与水、电流动到本地不同,算力互联网是将算力应用传输到合适的算力资源池并返回计算结果。"
信通院的核心定义一句话概括:算力是一个个静止的池子,GPU、服务器、机房机柜固定不动;算力互联网流动的不是算力硬件,是任务、数据、结果。
单志广等专家的观点更进一步:不存在 "把 A 地多余算力调拨给 B 地" 这件事;只存在 "把 B 地的任务路由到 A 地的池子里面跑"。
很多项目规划,就是被 "算力 = 水电" 这个错误比喻带偏了。一旦默认算力可以像电力一样无损耗、无门槛跨区域调配,就会做出完全脱离工程现实的规划:宣称所有算力全部全国自由调度,忽略网络延迟、流量成本、数据合规三大枷锁。
一个个智算中心,就是一个个独立的 "算力池塘"。池子本身原地不动。算力网的作用不是挖运河把池塘里的 "算力水" 运走;而是修一套智能编排系统 + 高速光纤路网,挑选合适的池塘,把作业丢进去运算,再取回答案。

回顾十年前的智慧城市疯狂期,所有城市的操作高度统一,堪称标准化流水线:
上级下发政策指标 → 地方政府立项冲固投 → 集成商进场总包工程 → 重金采购硬件大屏、服务器、摄像头 → 搭建一套看似万能的数字化平台 → 验收交付、新闻官宣、圆满收官。
唯独跳过了最核心的一步:真实刚需业务。
没有人思考,建好的系统谁来用?没有人关心,搭建的平台能解决什么问题?没有人考核,巨额投入能不能产生价值?
最终结局早已注定:平时系统休眠落灰,只有领导视察时开机亮屏。看似全城智慧化,实则空壳化,花大价钱造了一堆没有灵魂的数字摆设。
而现在的算力网、智算中心,正在部分复刻这套经典剧本。

部分西部及产业密度较低的城市,在本地 AI 企业、模型需求、算力消费场景有限的背景下,跟风砸钱建智算中心、算力调度平台、超大可视化大屏。官方宣传永远是:盘活闲置算力、东西算力互通、赋能数字经济。
据信通院 2025 年公开口径,国内智算共算量约 38 亿卡时,用算量仅 14 亿卡时,用算占比约 36.8%。IDC 统计显示,企业级通用算力中心利用率仅 10%—15%;另有公开报道显示,某西部智算园区全年综合算力利用率不足五成,新建大型国产算力机房上架率不足 20%,年亏损达千万级。
这些数据口径不同 —— 智算用算占比、通用算力利用率、单点园区样本 —— 但指向同一个事实:上架率与有效利用率差异很大,大量算力在空转。
崭新的 GPU 集群常年空载,每年千万级的运维成本、电费、人工成本纯靠财政硬扛。
当年是闲置的政务服务器,现在是闲置的高端算力卡。当年是炫酷无用的城市大屏,现在是数据虚假的算力调度大屏。换了硬件,换了名词,没换的是 "重建设、轻运营、无业务、纯政绩" 的内核。

按信通院口径,调度成立有严格前置条件:
任务属于离线批处理、大模型预训练、渲染、科学计算;
时延容忍度高;
业务数据允许跨地域传输;
节省的电费 > 跨城传输的带宽成本。
自动驾驶、在线推理、金融医疗涉密业务,天然不支持跨省长距离强实时调度,只能就近部署。
把这几条条件拿去对照你手上的项目,大部分宣称 "全域自由调度" 的愿景会立刻暴露出边界。

这套商业模式下,工程乙方、地方考核指标都得到满足,但公共财政与真正的产业发展,却可能为此买单。
不管是早年的智慧城市,还是现在的算力基建,核心商业模式从来不是 "做服务、赚运营钱",而是一次性工程总包。立项、招标、施工、交付、验收、回款,一套流程走完,项目直接结束。至于后续算力能不能租出去、平台能不能用起来、资产会不会闲置,和乙方没有半点关系。他们只需要把大屏做够炫酷、系统做够完整、硬件堆够数量,就能稳稳赚取工程利润。
地方政府也没有动力拒绝,在考核体系里,固定资产投资、重大项目落地、数字经济规模,是最直观、最好看、最容易出成绩的指标。建一座算力中心,就是实打实的巨额固投,就是亮眼的招商成果。至于长期利用率、产业营收、真实产出,都是后置的、模糊的、无人追责的指标。
于是就形成了一个闭环:
政策催着建、考核逼着建、企业哄着建,最后全民买单一堆无效资产。
这也是为什么所有人都心知肚明,很多算力项目是新版政绩工程,却依然愈演愈烈的根本原因。
新华社《瞭望》2026 年 5 月调研也指出:受周边城市不断拉高的算力补贴标准和算力建设规模影响,"害怕错失机遇" 的焦虑情绪蔓延,一些原本预设的理性发展路径出现跑偏、变形。这句话,几乎可以作为这一轮跟风建设的注脚。

很多文章讲到 "池子模型" 就结束了,但一线操盘手知道,真正的坑在 "调度" 这两个字下面。你以为接个 API 就能跨域跑任务?太天真。
厂商说 "适配 N 款芯片",一线要知道:驱动版本、容器插件、集合通信库(HCCL/NCCL,多卡协同训练必备的集合通信库)、算子库、编译前端、PyTorch/DeepSpeed/Megatron 脚本、算子覆盖、故障重调度是否全通。
国内智算芯片路线多元,CPU/GPU/ 国产 NPU 软件栈不一,跨架构迁移适配成本极高。很多统一平台只做到 "资源可见",没做到任务自动跨架构运行 —— 严格说,是未通过统一镜像、算子、集合通信和断点续训验证的平台,常仅完成资源注册与状态可见,跨架构自动跑任务比例有限。这正是信通院说的 "找不着、调不动、用不好" 里的 "调不动"。
智算中心内高性能训练常用 IB 或 RoCE(以太网无损);IB 低时延高带宽但生态封闭、成本高,RoCE 基于以太网、成本低但拥塞控制和长距无损要调。
跨城长距 RDMA 目前正从现网验证走向商用,存在长距拥塞反馈慢、跨域流控、集合通信拓扑编排等难题。2026 年已有百公里‑600 公里级长距 RDMA 训推、任务迁移、空芯光纤降时延等验证案例,但万卡规模跨域同步训练仍受距离与带宽制约,不能默认实现无条件全量跨域。
因此实时推理要毫秒级,必须留本地 / 边缘;离线任务可西迁,但要看回传。跨集群的 RDMA over WAN、RoCE v2、广域丢包、跨集群拓扑感知,都是一线运维的真痛点。不通就只能 "同池调度",谈不上全国调度。
医疗、金融、政务、工业图纸、模型权重:按数据分类分级和合规要求,部分原始数据、权重、标注库禁止出域。此时可以在本地算、出域只传脱敏特征 / 中间结果 / 元信息,或用隐私计算、联邦学习、可信执行环境;调度器也可能退化为 "资源目录 + 人工工单"。
制造业很多核心业务因此只能本地跑,平台自动匹配西部低价算力在业务上不成立。这不是调度器的天然缺陷,而是合规约束下的合理降级 —— 把 "退化成目录" 一概而论,反而不够专业。

真算力基建的 4 个特征
1. 考核营收,不考核大屏不以平台上线、界面炫酷为验收标准,核心考核 GPU 上架率、对外营收、外部客户占比,企业收益和算力出租业绩挂钩。
2. 重软件、重网络、重运营预算不止堆硬件,大量资金投入异构算力适配、跨域调度网关、骨干传输网络、专业运维团队,专门解决信通院提出的算力互联网三大痛点:找不着、调不动、用不好。
3. 先有订单,后建基建立项前就锁定外部企业预签约算力订单,清楚承接的是训练、渲染、批处理这类可跨域传输的业务;不会盲目宣传 "全部算力全域调度"。
4. 尊重边界,承认约束主动区分业务类型:实时推理任务本地就近部署;仅离线任务才跨池调度,坦然承认时延、带宽成本、数据不出域三大天然约束,不会套用水电网做无边界宣传。

伪算力工程的 4 个特征:
1. 纯一次性工程交付,验收即结束,无任何营收、利用率考核,只拼硬件规模和大屏展示效果。
2. 预算严重偏硬件,机房装修、GPU 硬件、调度大屏占大头,调度软件、骨干专网投入极少。只是把各个机房的数字汇总到大屏展示,池子之间无法流转任务。
3. 本地算力需求有限,立项报告全是 "未来规划、预期招商",没有锁定的真实客户。
4. 口号极端宏大,照搬水电网叙事,宣称全域算力自由调度,完全无视带宽成本和合规红线。

回复

使用道具 举报

36

主题

1万

帖子

7万

积分

超级版主

Rank: 8Rank: 8

积分
71743
发表于 6 天前 | 显示全部楼层
搞钱为主,建成之后啊?再说呗

点评

AI竞赛,全世界只有我们入了坑。  发表于 6 天前
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|小黑屋|手机版|Archiver|机械荟萃山庄 ( 辽ICP备16011317号-1 )

GMT+8, 2026-10-10 13:04 , Processed in 0.063101 second(s), 21 queries , Gzip On.

Powered by Discuz! X3.4 Licensed

Copyright © 2001-2021, Tencent Cloud.

快速回复 返回顶部 返回列表