第 1 章 概述... 1
1.1 算力:数字时代的核心生产力... 1
1.2 AI:新质生产力的重要引擎与算力需求的变革者... 5
1.3 智能算力:为 AI 而生的计算新范式... 11
1.4 AI 大模型:驱动智能算力走向超大规模的核心引擎... 12
1.5 标准化:构建产业协同的基石... 13
第 2 章 AI 对智能算力基础设施的需求... 15
2.1 AI 发展对算力的宏观需求与驱动... 15
2.1.1 技术演进重塑算力基础设施的需求... 15
2.1.2 算力规模增长与结构演变... 16
2.2 智能算力服务模式分类 ... 20
2.3 大模型预训练场景的需求... 21
2.3.1 预训练对智能算力基础设施的功能需求... 21
2.3.2 预训练对智能算力基础设施的资源需求... 23
2.4 大模型微调场景的需求 ... 25
2.4.1 SFT:追求极致性能的高昂路径... 27
2.4.2 PEFT:兼顾效果与成本的主流选择... 28
2.4.3 微调的资源需求与策略选择 ... 31
2.5 大模型推理场景的需求 ... 33
2.5.1 模型准备与优化:奠定高效推理的基础... 34
2.5.2 推理对智能算力基础设施的资源需求 ... 39
第 3 章 智能算力基础设施的关键技术 ... 41
3.1 多元异构计算 ... 41
3.1.1 多元异构计算的架构... 41
3.1.2 智算服务器架构设计理念... 462
3.1.3 深度学习训练型 AI 服务器... 47
3.1.4 智能应用推理型 AI 服务器... 48
3.1.5 技术发展趋势...49
3.2 芯片间高速互连...50
3.2.1 PCIe... 50
3.2.2 CXL... 52
3.2.3 NVLink... 55
3.2.4 PCIe、CXL、NVLink 的对比... 57
3.3 节点间高性能无损网络...58
3.3.1 核心使能技术 RDMA...58
3.3.2 关键网络架构与拓扑...62
3.3.3 应用方案:从智算中心内到跨广域网... 69
3.4 弹性高速存储... 73
3.4.1 AI 大模型的存储需求...73
3.4.2 主流存储技术的适用性...75
3.4.3 优化存储性能和成本的策略... 76
3.5 并行加速技术... 77
3.5.1 数据并行...78
3.5.2 张量并行...79
3.5.3 流水线并行...81
3.5.4 混合并行与使能技术...82
3.6 模型优化关键技术...83
3.6.1 模型压缩...84
3.6.2 提示词工程...91
3.6.3 RAG... 93
3.7 资源管理与调度...95
3.7.1 异构算力管理与调度的挑战... 95
3.7.2 异构算力管理与调度的关键技术... 96
3.8 智能体... 98
3.8.1 核心架构与关键组件...99
3.8.2 人机协同模式... 100
3.8.3 主要应用场景与产业实践... 101
3.9 AI 安全 ... 101
3.9.1 数据安全... 102
3.9.2 模型安全... 103
3.9.3 应用安全... 104
第 4 章 智能算力基础设施的建设 ... 106
4.1 总体架构 ... 106
4.1.1 硬件层... 108
4.1.2 软件层... 108
4.1.3 平台服务层... 109
4.1.4 业务系统层... 109
4.1.5 运维管理层... 109
4.2 网络建设方案 ... 110
4.2.1 参数网络... 112
4.2.2 存储网络... 117
4.2.3 业务网络... 120
4.2.4 管理网络... 122
4.3 资源配置方案 ... 127
4.3.1 GPU 服务器配置 ... 128
4.3.2 存储资源配置... 129
4.3.3 其他服务器资源... 137
4.4 资源池管理方案... 139
4.4.1 核心功能... 139
4.4.2 资源池管理平台系统架构与技术选型 ... 144
4.5 安全建设方案 ... 146
4.5.1 资源池安全风险分析... 146
4.5.2 资源池安全防护目标... 149
4.5.3 纵深防御:分层安全建设方案与技术选型 ... 151
4.6 AI 平台建设方案 ... 155
4.6.1 AI 平台的核心定位与功能... 1564
4.6.2 AI 平台建设路径与技术栈选型... 157
第 5 章 算力互联互通...160
5.1 算力网络...160
5.1.1 算力网络的背景...160
5.1.2 算力互联互通的核心需求... 162
5.1.3 算力互联互通的流程机理... 166
5.1.4 算力网络的参考架构...173
5.2 跨域算力调度系统...177
5.2.1 系统定位...177
5.2.2 功能架构...179
5.2.3 关键技术...180
5.3 算力网络的产业实践...188
5.3.1 电信运营商:网络的构建者与服务的主导者...188
5.3.2 设备与方案供应商:全栈技术的赋能者...188
5.3.3 云服务提供商:算力供给与平台创新的核心...189
5.4 算力网络的未来发展趋势...189
第 6 章 行业大模型构建与应用...191
6.1 行业大模型构建...191
6.1.1 行业需求分析与资源评估... 192
6.1.2 行业数据与大模型共建...195
6.1.3 行业大模型微调与优化部署... 198
6.2 行业大模型能力评价指标...200
6.2.1 行业大模型基础能力评估... 200
6.2.2 行业大模型服务能力评估... 205
6.3 DeepSeek 大模型在银行系统部署的行业实践案例 ...207
6.3.1 挑战与需求分析...208
6.3.2 系统架构设计...208
6.3.3 系统部署与持续优化...210
6.3.4 成本估算...211
6.4 大模型应用面临的风险与应对措施... 214
6.4.1 大模型的幻觉问题... 214
6.4.2 信息安全及隐私风险... 215
6.4.3 算法偏见与社会公平性挑战 ... 216
第 7 章 超大规模集群展望... 218
7.1 超大规模集群是通向更强 AI 的算力阶梯... 218
7.2 超大规模集群面对的挑战与应对方案 ... 219
7.2.1 应对功耗挑战:园区级部署与散热方案... 220
7.2.2 应对网络挑战:超大规模拓扑设计策略... 221
7.2.3 优化物理互连:布线方案与成本效益 ... 223
7.2.4 保障系统稳定:可靠性设计与故障恢复... 223
7.2.5 控制建设成本:网络技术选型与权衡 ... 225
参考文献... 229