大规模 AI 数据中心 — 技术面试问题集

深度研究·扩充版 v2.0 · 面向 Deploy / Manage / Maintain Large Scale AI Data Centers

大规模 AI 数据中心 — 技术面试问题集(深度研究·扩充版)

面向职位:Deploy, Manage & Maintain Large Scale AI Data Centers(控制 / 网络 / 存储栈)
目标层级:8+ 年网络与数据中心经验 · 资深基础设施 / SRE / 网络工程师
版本:扩充版 v2.0 —— 在原始题库(10 大能力域、100+ 题含追问详解)基础上,基于 2025–2026 年公开资料深度研究补充:① 前沿速递事实表;② 每域新增/深化题;③ 三个新能力域(供电与液冷、真实集群案例、DPU 与加速器互连新标准)。


使用说明

  • 本问题集围绕岗位 JD 的每一项职责与"脱颖而出"要求编写,按能力域分组。
  • 每题标注难度(基础 / 进阶 / 专家)。点击展开查看参考答案要点与追问详解——先独立思考,再对照。
  • 重点准备:TCP/IP 深度、leaf-spine 架构、RDMA/RoCE、Lustre 调优、Ansible 自动化、跨团队排障。
  • 本版在每道题的"追问"后补充了完整解答,并新增 SONiC、eBPF、CXL、WEKA/DAOS、Terraform、拓扑感知,以及 2025–2026 的 Blackwell/NVLink 5、Ultra Ethernet(UEC 1.0)、Spectrum-X、800G/1.6T 交换、液冷供电、真实千卡/万卡集群等前沿题

一、2025–2026 前沿速递(深度研究核心结论 · 面试必背数字)

以下数字来自 NVIDIA、Broadcom、Ultra Ethernet Consortium、Data Center Dynamics、Next Big Future 等公开资料(2025–2026)。面试中能脱口而出这些量级,是区分"纸上谈兵"与"真做过"的关键。

1.1 算力与 GPU 互连

指标 数值 备注
Blackwell 晶体管 / 制程 208B / TSMC 4NP 双 die 通过 10 TB/s chip-to-chip 互连
第五代 NVLink(GB200 NVL72) 1.8 TB/s 每 GPU 双向 为 PCIe Gen5 的 14 倍
单 NVLink 域带宽(NVL72) 130 TB/s NVLink Switch 系统提供
最大 NVLink 域 576 GPU / >1 PB/s 总带宽 / 240 TB 显存(NVL72 单体) 较 2014 年首代 NVLink 总带宽提升 900 倍
GB200 NVL72 72 Blackwell GPU + 36 Grace CPU,13.4 TB HBM3E,576 TB/s 显存带宽 全液冷,较上代训练性能 4×、实时推理 30×
GB300 NVL72 72 Blackwell Ultra GPU,全液冷(无风冷版本) 面向 test-time scaling 推理
Spectrum-X 自适应路由有效利用率 >97%(ECMP 仅 50–60%) 在 xAI Colossus 十万卡上实测 95% 吞吐、零碰撞丢包
ConnectX-8 SuperNIC 800 Gb/s,PCIe Gen6(2025) 带来 SHARP v4,以太网侧也能做 in-network all-reduce

1.2 网络交换与传输

指标 数值 备注
Broadcom Tomahawk 5 51.2 Tbps,64×800GbE / 128×400GbE 5nm 单 die,RoCEv2 优化
Broadcom Tomahawk 6 102.4 Tbps,64×1.6T,3nm(2025 发布) 两档:TH6-200G(512×200G)、TH6-100G(1024×100G);可 2 层连接 128K XPU
Jericho3-AI 深缓冲 + VOQ,面向 AI 长流/突发 Broadcom 称 JCT 较 InfiniBand 快 ~10%
Ultra Ethernet 1.0(UEC) 2025 年 6 月发布 开放、多厂商;目标 1M endpoint 规模
UET 关键机制 包喷洒(packet spray) + 多路径 RDMA + 乱序投递 NIC 重组 + 选择性重传 + 收发双向拥塞控制 不依赖 PFC 无损 fabric
以太网占比 2025 年超大规模新 GPU 集群 62% 用以太网 fabric(2022 仅 41%) RoCEv2 单端口成本较 IB 低 35–50%

1.3 存储

1.4 供电与液冷(2025–2026 最大变量)

指标 数值
A100 时代单机柜 10–15 kW(风冷)
GB300 NVL72 整柜 130–142 kW,全液冷标配
Vera Rubin NVL72(2026) 230–300 kW/柜,45℃ 温水直冷(干冷器免压缩机制冷)
Rubin Ultra / Kyber(2027 路线图) 高达 600 kW/柜
Google 公开讨论 1 MW/柜 设计
液冷渗透率 数据中心整体:2024 约 14% → 2025 约 33% → 2026 AI 芯片约 47%
液冷 PUE 可降至 1.15(风冷通常 1.5+)
美国数据中心用电 2026 约 75.8 GW,2030 约 134 GW(IEA 高增情景)
中国政策(2026) 新建数据中心液冷渗透率 ≥60%;"东数西算"枢纽节点 PUE ≤1.2,液冷 ≥70%

1.5 真实大模型集群(2025–2026 在役规模)

集群 规模 功率 状态
xAI Colossus(孟菲斯) 10 万 H100 122 天建成(2024-05→09);2026 初约 55.5 万 GPU(H100/H200/GB200) 目标 2 GW,成本约 $18B,目标 100 万卡 运营+扩张
OpenAI Stargate(Abilene) 8 栋,目标 ~1.2 GW;$500B 计划,2029 年 ~10 GW 部分在线(4/8 栋) 在建
Meta Prometheus(俄亥俄) ~50 万 GPU ~1.02 GW 2026 上线
Meta Hyperion(路易斯安那) 多 GW 建设
Microsoft Fairwater GW 级 资本开支 >$100B(完建) 建设

二、10 大能力域(原始题 + 2025–2026 深化/新增)

难度图例:基础 · 进阶 · 专家

01 · 网络基础 & TCP/IP 协议栈

考察 OSI/TCP-IP 模型、IP 编址、路由与传输层机制,是底层硬功。

▶ 详细解释 TCP 三次握手与四次挥手,并说明为什么 TCP 连接需要 TIME_WAIT 状态? TCP · 进阶
- 要点:三次握手(SYN → SYN/ACK → ACK)建立双向可靠通道;四次挥手是因为 TCP 全双工,每侧独立关闭(FIN/ACK)。TIME_WAIT 存在两个原因:① 保证最后 ACK 能重传(对端可能没收到);② 让旧连接的迷途报文在网络中消亡,避免被新连接(同四元组)误收。
- 追问:高并发短连接服务器 TIME_WAIT 堆积如何缓解?(tcp_tw_reusetcp_tw_recycle 慎用、SO_REUSEADDR、连接池、长连接)。
- 追问:为什么不能用两次握手建立连接?SYN Flood 攻击与防护(SYN Cookie)?拥塞控制与流控的区别?
- :两次握手缺陷——无法确认"客户端接收能力"与"服务端发送能力"双向就绪;延迟到达的旧 SYN 被响应会致服务端误建连接、分配资源,造成半开连接浪费。SYN Flood:伪造源 IP 的 SYN 占满半连接队列;防护:① SYN Cookie(状态编码进 ISN,收到合法 ACK 才建连);② 增大 net.ipv4.tcp_max_syn_backlog;③ SYN Proxy/限速;④ 开启 tcp_syncookies流控 vs 拥塞控制:流控(滑动窗口)端到端防淹没接收方 buffer;拥塞控制网络视角,依丢包/延迟/RTP 信号防压垮路径。

▶ 解释 TCP 的拥塞控制算法(慢启动、拥塞避免、快重传、快恢复),并对比 Reno / CUBIC / BBR。 TCP · 专家
- 要点:slow start 指数增窗到 ssthresh;拥塞避免线性增窗;丢包触发降窗。Reno 基于丢包、AIMD 收敛慢、高 BDP 利用率低;CUBIC(Linux 默认)以时间函数逼近上次 cwnd,适合高带宽;BBR 基于带宽/RTT 模型估计,不把丢包当拥塞信号,适合有 bufferbloat 的长肥管道。数据中心场景:AI 训练东西向流量大、RTT 小,BBR 或专用 RDMA 更优。
- 追问:什么是 bufferbloat?为什么 AI 集群内部更依赖 RDMA 而非 TCP?
- bufferbloat 指中间设备缓冲过大,TCP 误当可用带宽持续填满,排队延迟飙升(数百 ms)。解决靠 AQM(CoDel/FQ_Codel)与 BBR。AI 内更依赖 RDMA:训练 AllReduce 频繁、消息多而小、对延迟与 CPU 开销极敏感;TCP 经内核协议栈 CPU 占用高、延迟抖动大,易成瓶颈。RDMA 旁路内核、零拷贝、微秒级,配合 GPUDirect 直接 GPU↔NIC 收发,几乎不占主机 CPU。(2025 深化) NVIDIA Spectrum-X 的 BlueField-3/ConnectX-8 把拥塞控制跑在 NIC 内(每秒百万级拥塞事件、微秒级反应),并对自适应路由做接收端乱序重组,对应用透明——这是以太网侧追赶 InfiniBand 的关键工程。

▶ 给定 10.20.32.0/20,计算可用主机范围、子网掩码、广播地址,并划出 4 个等量子网。 IP 编址 · 基础
- 要点:/20 → 掩码 255.255.240.0,主机位 12 位 → 4096 地址、4094 可用。网络 10.20.32.0,广播 10.20.47.255。均分 4 个子网借 2 位 → /22:10.20.32.0/22、10.20.36.0/22、10.20.40.0/22、10.20.44.0/22。
- 实操追问:数据中心管理网 / 存储网 / 业务网如何做地址规划与隔离?

▶ ARP 如何工作?ARP 欺骗的原理与防护手段有哪些? L2 / 安全 · 进阶
- 要点:ARP 广播请求→单播应答,无验证机制。欺骗者伪造 ARP 应答劫持流量(中间人)。防护:交换机 DAI(Dynamic ARP Inspection)+ DHCP Snooping 绑定表、静态 ARP、端口安全、私有 VLAN、网络分段。
- 追问:在 AI 集群中,为什么控制面/存储面要物理或 VLAN 隔离以防 L2 攻击?
- :控制面(管理/带外/BMC/IPMI)一旦被 L2 攻击劫持,集群会"失管";存储面被嗅探/篡改直接泄密或破坏训练数据。物理隔离或 VLAN + ACL + DAI + 端口安全可缩小广播域与攻击面,满足等保/ISO 合规,并把故障域限制在单一平面。

▶ MTU 与 MSS 的关系?为什么数据中心普遍启用 Jumbo Frame(9000)?有什么坑? L2 / 性能 · 进阶
- 要点:MSS = MTU − 40(IP+TCP 头)。Jumbo Frame 减少每包 CPU 中断与头部开销,提升大块数据传输(存储/NFS/RDMA over Ethernet)吞吐。
- :① 整条路径(含交换机、网卡、虚拟化、隧道)必须一致,否则分片或丢包;② vxlan 封装额外预留 50 字节;③ TCP 路径 MTU 发现失败导致"黑洞"。务必端到端 ping -M do -s 8972 验证。

▶ BGP 与 OSPF 的核心区别?在数据中心为什么常选 BGP(eBGP/Route Reflector)做 Underlay/Overlay 路由? 路由 · 专家
- 要点:OSPF 链路状态、IGP、收敛快;BGP 路径矢量、EGP、策略强、扩展性好。Clos/leaf-spine 用 eBGP(每 leaf/spine 不同 AS)做 underlay 天然无环路、易 ECMP、策略清;overlay(EVPN)也跑 BGP。规模上千节点 BGP 更可控。
- 追问:ECMP 如何实现?BGP 多路径与一致性哈希?
- ECMP 对多条等 cost 路由按哈希(源/目的 IP + 端口 + L4)逐流负载分担。BGP maximum-paths 允许多 next-hop 同装。注意哈希极化(多跳 ECMP 同哈希致流量集中):用对称哈希、报文头注入熵(VXLAN/GRE 内层五元组)、或一致性哈希保证某流稳定走同路径且链路故障时最小化重映射与乱序。(2025 深化) Broadcom Tomahawk 6 的 GLB 2.0 用全网拥塞信息做逐包选路,吞吐较传统哈希 ECMP 高 50%;NVIDIA Spectrum-X 自适应路由在 100k GPU 上把有效利用率从 50–60% 抬到 >97%。

▶ 什么是 RDMA?RoCE v1/v2 与 iWARP、InfiniBand 的区别?为什么 AI 训练离不开它? RDMA · 专家
- 要点:RDMA 让网卡直接读写对端内存,绕过 CPU 与内核,延迟微秒级、CPU 占用极低。InfiniBand 专用、无损、性能最佳;RoCEv2 在 UDP/IP 上跑 RDMA,复用以太网,但需无损网络(PFC/ECN);iWARP 基于 TCP,丢包友好但性能弱。AI 训练 AllReduce 量大,TCP 的 CPU 开销与延迟成瓶颈 → 必须 RDMA。
- 追问:RoCE 的无损网络如何保证?PFC 死锁风险与 ECN 调优?
- PFC(802.1Qbb)在优先级队列级反压实现无损,但有死锁风险(多优先级/多跳反压成环全部停发)及 head-of-line blocking 与 PFC 风暴。缓解:① 仅启用 RoCE 所需少数优先级;② 严格优先级调度 + DSCP→PFC 映射;③ 启用 ECN 让拥塞时端到端降速而非反压;④ PFC 看门狗。ECN 调优:设 marking min/max 阈值与 CNP 节奏,用 ib_send_lat/ib_write_bw 基准,监控 PFC pause 帧计数(应趋零)与 RoCE 重传率。(2025 深化) DCQCN 2025 年获 SIGCOMM"经典之作奖";在 1k–16k GPU 集群把 RoCEv2 goodput 维持在线路速率 5–10% 以内,避免 all-reduce 因丢包重传致 GPU 利用率跌 15–40%。

▶ QUIC 与 TCP 在数据中心内部的应用前景? 传输层 · 进阶
- 要点:QUIC 跑在 UDP 上,内置 TLS1.3、0/1-RTT 建连、多路复用无队头阻塞、连接迁移。数据中心内对外服务(API 网关、对象存储前端)用 QUIC/HTTP3 收益明显;内部东西向 GPU 通信仍由 RDMA 主导。(2025 深化) 即便有 RDMA,控制面/管理面/对象存储/S3 访问、跨 AZ 同步仍走 TCP/HTTP,QUIC 的 0-RTT 与多路复用降低控制面延迟、消除队头阻塞,与 RDMA 职责互补。

▶ 网络可观测性:sFlow / NetFlow / gNMI 的区别与适用场景? 可观测 · 专家
- 要点:sFlow 采样型(报文头抽样,开销低);NetFlow/IPFIX 流聚合(五元组+计数,计费/溯源);gNMI(gRPC+OpenConfig)流式遥测(订阅推设备状态,秒/亚秒级)。AI 集群强调 gNMI + PFC/ECN/IB 计数器监控。(2025 深化) NVIDIA DOCA 遥测栈、Mellanox OFED 暴露每队列 ECN 标记率、PFC pause 帧、RDMA NIC 计数器(rx/tx 完成率、NAK 数),接入 Prometheus/Grafana 是 fabric 健康基线。

【新增·2025】▶ 在十万卡级 RoCE 集群中,DCQCN 与 UEC 的拥塞控制哲学有何根本差异? 拥塞控制 · 专家
- 要点:DCQCN 是"ECN 标记 + 发送端降速"的端到端速率控制,依赖 PFC 提供无损底座;UEC 1.0 则不要求 PFC 无损 fabric,用选择性重传 + 收发双向拥塞控制 + 包喷洒,把丢包当常态、用 NIC 重组保序。前者成熟、部署广(微软/Meta/云厂商);后者是 2025 年新标准,面向 1M endpoint、避免 PFC 死锁与哈希极化,生态尚在成形(AMD Pollara 400GbE 为首个合规 NIC,由 Oracle 部署)。
- 追问:为什么大厂既用 RoCE 又投入 UEC?——RoCE 解决"今天",UEC 解决"明天超大规模+多厂商互通+避免 PFC 脆弱性"。

【新增·2025】▶ 什么是 UALink?它与 NVLink、UEC 分别是什么关系? 加速器互连 · 专家
- 要点:UALink(Ultra Accelerator Link)是由 AMD、Intel、Broadcom、Cisco、Meta、Microsoft 等推动的开放 scale-up 互连标准,旨在打破 NVLink 在机内/机柜内 GPU 间互连的封闭性,定义多加速器(GPU/ASIC)间的缓存一致性与内存语义。与 NVLink(NVIDIA 专有机内高速专网)、UEC(以太网 scale-out 传输)互补而非替代:UALink 管"柜内 scale-up",UEC/NVLink 管"跨节点 scale-out/柜间"。面试加分点:能区分 scale-up(NVLink/UALink,低延迟、紧耦合)与 scale-out(IB/RoCE/UEC,跨节点)两层网络。

02 · 以太网交换 & 数据中心架构

交换机配置、VLAN、生成树、leaf-spine、VXLAN/EVPN、链路聚合。

▶ 画出并解释经典 Leaf-Spine(Clos)拓扑,说明它相比传统三层架构的优势。 架构 · 进阶
- 要点:Leaf(TOR)= 服务器接入;Spine = 核心,leaf 与每个 spine 全连接,任意服务器间跳数固定(≤2)。优势:① 水平扩展带宽;② 天然多路径 ECMP;③ 无阻塞(oversubscription 可控);④ 适合东西向流量。
- 追问:oversubscription ratio 如何设计?——训练东西向极大,leaf-spine 常 3:1 甚至 1:1;存储/管理面可 4:1~10:1。GPU 训练节点收敛比 ≤3:1,关键轨(rail)尽量 1:1。

▶ VLAN、Trunk、Access 端口的区别?802.1Q 标签结构?PVLAN 用途? L2 · 基础
- 要点:Access 单 VLAN 剥离 tag;Trunk 打 802.1Q(TPID 0x8100 + 12-bit VLAN ID + 3-bit PCP + 1-bit DEI)承载多 VLAN。PVLAN 隔离同 VLAN 内主机(社区/隔离端口),用于多租户。

▶ 生成树协议(STP/RSTP/MSTP)的作用与缺陷?为什么 leaf-spine 中要避免 STP? L2 · 进阶
- 要点:STP 阻塞冗余链路防环,代价带宽浪费、收敛慢。leaf-spine 全连接跑 STP 会 blocking 大量链路;现代方案用三层路由(ECMP/BGP)或 VXLAN+EVPN overlay,无需 STP。

▶ 解释 VXLAN 与 EVPN。为什么需要用 BGP EVPN 作为 VXLAN 的控制平面? Overlay · 专家
- 要点:VXLAN 用 24-bit VNI 把 L2 帧封装 UDP(4789),突破 4094 VLAN 限制。EVPN 用 BGP 分发 MAC/IP 可达性(Type 2/3),避免泛洪学习、支持对称/非对称 IRB、多活(Anycast VTEP)。
- 追问:VXLAN 封装开销 ~50 字节,内层 1500 需外层 ≥1550;内层 jumbo 9000 需外层 9050,否则分片/黑洞。头端复制(HER)vs BUM 组播。

▶ LACP(802.3ad)如何工作?active 与 passive 模式区别?服务器 dual-homed 设计? 链路聚合 · 进阶
- 要点:LACP 通过 LACPDU 协商聚多物理链成逻辑口。active 主动发、passive 仅响应(双 passive 不聚合)。服务器 dual-homed 用 MLAG/vPC 或 Linux bond + 两上行。

▶ 你在生产环境配置过哪些品牌的交换机?描述一次复杂的交换机排障。 实战 · 进阶
- 要点:展示 CLI/自动化配置(VLAN、port-channel、BGP、ACL),讲清"现象→隔离→根因→修复→复盘",最好有量化指标(丢包率、RTT、PPS)与数据(抓包、计数器、telemetry)。(2025 深化) 可补充 SONiC/白盒、Broadcom Tomahawk 5/6、NVIDIA Spectrum-4/XP 的操作经验。

▶ 什么是 PFC 与 ECN?RoCE 无损网络如何配置与验证? 无损网络 · 专家
- 要点:PFC 按 8 优先级暂停单队列(反压)实现无损,但易死锁/HOL;ECN 在 IP 头标记拥塞让发送端降速。验证:ib_send_latshow priority-flow-control、监控 PFC pause 帧、RDMA 带宽/延迟基准。(2025 深化) 配置 DSCP(RoCE 用 CS3/EF)映射到无损优先级;交换机仅该优先级开 PFC + 设 buffer 阈值;开 ECN 设 min/max;PFC 看门狗防死锁。指标:PFC pause 帧趋零、ibstat/perfquery 重传、ib_write_bw 带宽、ib_send_lat 延迟。

▶ 什么是 SONiC?白盒交换机对 AI 数据中心的网络意味着什么? 白盒/SONiC · 专家
- 要点:SONiC(微软开源)解耦网络 OS(Linux 内核 + Switch ASIC SDK + 容器化组件),支持多厂商硬件。意义:① 打破厂商锁定、降 TCO;② 统一定制(自动化、telemetry、RDMA 调优);③ 快速跟新特性(RoCE、EVPN)。挑战:运维复杂、排障、生态成熟度。超大规模集群普遍采用 SONiC/自研 ASIC。(2025 深化) 2026 年 Cisco 计划把 SONiC 基金会能力带给超大规模之外的客户;NVIDIA Spectrum-X 也兼容 Pure SONiC,说明 SONiC 已成 AI fabric 主流底座之一。

▶ 什么是 EVPN Type-5 路由(对称 IRB)? EVPN · 专家
- 要点:Type-5(IP Prefix)通告外部/三层前缀,实现 overlay 三层互通与 DCI。对称 IRB:两端同层做路由(bridge domain + L3 VNI),避免非对称 IRB 首包泛洪/次优路径,是 VXLAN 多租户三层互通标准。

【新增·2025】▶ Broadcom Tomahawk 6 与 NVIDIA 的 Scale-Up Ethernet(SUE) 对 AI 网络意味着什么? 交换芯片 · 专家
- 要点:Tomahawk 6(2025,3nm)单芯片 102.4 Tbps、64×1.6T,可 2 层连 128K XPU,减少 tiers → 更低延迟、更易负载均衡、更少光模块;并引入 Scale-Up Ethernet (SUE) Framework——在标准以太网之上建新传输,单芯片可连 512 XPU 提供单跳 all-to-all。这标志以太网从"scale-out"向"柜内 scale-up"渗透,与 UALink/NVLink 竞争机内互连。
- 追问:为什么"减少 tiers"重要?——AI 集合通信对跳数与 JCT 极敏感,2 层 vs 3 层直接影响 AllReduce 延迟与光模块成本。

【新增·2025】▶ 什么是 rail-optimized(轨道优化)网络?与传统 leaf-spine 怎么选? 架构设计 · 专家
- 要点:传统 leaf-spine 非为 AI 全互连设计;rail-optimized 让同号 GPU 跨节点直连同一 leaf/spine,使同种集合通信(跨节点 AllReduce)走最短无冲突路径,收敛比尽量 1:1。代价:更多线缆、更多交换机、更细的机架规划与走线/气流管理。NVIDIA 在 Spectrum-X SuperPOD 中大量采用 rail 设计。选型:前沿训练用 rail;轻量推理传统 leaf-spine 仍够。

【新增·2025】▶ 当集群超过 ~2 万卡,spine-leaf 还是 Dragonfly 更优? 拓扑 · 专家
- 要点:spine-leaf(Clos) 在 ≤~16k 加速器时最优(简单、多厂商、可预期无阻塞);>20k 卡时 Dragonfly/Dragonfly+ 因更少线缆与光模块有 22–30% 成本优势。2025 年 spine-leaf 占 fabric 市场 54.3%、Dragonfly 28.4% 但增长更快(CAGR 19.8% vs 17.5%)。大型 Mega-cluster 趋势明显。

03 · Linux 网络 & 内核 Internals

iptables/nftables、netns、tcpdump/Wireshark、sysctl 调优、socket 与路由。

▶ iptables 的四表五链是什么?只允许 Established 入站、开放 22/80/443 的规则集,并说明如何改成 nftables。 防火墙 · 进阶 ——(原始要点:filter/nat/mangle/raw+security;PREROUTING/INPUT/FORWARD/OUTPUT/POSTROUTING;默认 DROP INPUT + ESTABLISHED,RELATED ACCEPT + 开放端口;nftables 用 inet 族、set 管理端口)。追问:conntrack 表耗尽症状与处理;DOCKER 链注入。

▶ 服务器网络不通,你的系统化排障步骤? 排障 · 基础 ——(ip addr/ip linkip routeping 网关 → traceroute/mtrss -tunlpiptables -L -n -vtcpdump → ARP/MTU/网卡 offload;强调 L1→L7 分层 + 对比正常节点)。

▶ tcpdump 抓出"三次握手完成但应用无响应"的数据包,如何分析?抓 443 前 100 包命令。 抓包 · 进阶 ——(tcpdump -i any -nn -s0 -c 100 'tcp port 443' -w cap.pcap;看 SYN 无 SYN/ACK=监听未起/防火墙;握手后有 PSH 无服务端 ACK=应用阻塞;RST 位置判对端拒连)。

▶ Linux 网络命名空间(netns)与 veth 如何用于容器/多租户?和 bridge 的关系? 虚拟化 · 进阶 ——(netns 独立协议栈;veth pair 连通两 netns;bridge 做 L2 交换;Docker/K8s 基础)。追问:K8s CNI(Calico/Flannel/Cilium)——Flannel 简单 VXLAN overlay 分配 Pod CIDR;Calico 用 BGP 通告 Pod 路由 + 强 NetworkPolicy;Cilium 基于 eBPF,高性能 L3-L7 策略,可替 kube-proxy。

▶ 为 AI 训练节点做 Linux 网络性能调优,改哪些 sysctl 和网卡设置? 调优 · 专家 ——(net.core.rmem_max/wmem_maxtcp_rmem/tcp_wmem 调大;tcp_congestion_control=bbrsomaxconn;网卡多队列 + RSS/RPS;关 gro/lro 对 RoCE 影响;irqbalance 与 NUMA 绑定;ethtool -K offload;先用 iperf3/perftest 量化再调)。(2025 深化) 训练节点还需把 GPU 的 NUMA 节点与 NIC、中断绑在同一 NUMA(见 07 NUMA),并用 NCCL_TOPO_FILE 固化最优路径。

▶ socket 生命周期与 TIME_WAIT/CLOSE_WAIT 含义。 Socket · 进阶 ——(listen/accept、connect 触发握手;TIME_WAIT 主动关闭方正常;CLOSE_WAIT 对端已关而本端没 close → 应用泄漏连接,大量则需查应用)。

▶ RedHat/CentOS 与 Ubuntu 网络配置差异?如何保持一致? 发行版 · 基础 ——(RHEL 用 NM+ifcfg/nmcli+keyfile;Ubuntu 用 netplan+YAML+systemd-networkd/NM;用 Ansible 抽象统一)。追问:CentOS 7→RHEL 9/Stream(network-scripts 弃用、默认 nftables、cgroup v2、内核 5.x、SELinux 更新、源切换;实验室验证 + 自动化滚动 + 回滚)。

▶ nftables 相比 iptables 的优势?大规模 ACL 优化? 防火墙 · 专家 ——(单内核模块、统一 inet 族、set/map 做 O(1) 查表、原子替换、规则合并;大 ACL 用 set 存 IP/端口 + ct state + counter)。

▶ eBPF 在网络观测与加速中的作用? eBPF · 专家 ——(内核沙箱挂载程序,无改内核做细粒度观测/加速;Cilium 用 eBPF 做 Service LB 替 kube-proxy、L3-L7 策略;XDP 驱动层 DDoS 限速;TCP 拥塞控制可插拔 eBPF)。追问:与 iptables/nftables 共存——层次不同,可保留 iptables 做边界、eBPF 做加速,功能重叠时统一避免双重处理。

▶ Linux 上如何做网络 QoS(tc、HTB、fq_codel)?为何训练集群要控制缓冲? QoS · 进阶 ——(tc 框架;HTB 层级限速保底;fq_codel 是 AQM 缓解 bufferbloat;训练集群对延迟敏感,需对管理/存储/业务分级 + fq_codel 防大流饿死小流;配合 DSCP+交换机 PQ 端到端 QoS)。

【新增·2025】▶ 如何用 eBPF/XDP 在 AI 集群做线速 DDoS 防护与微突发检测? eBPF · 专家
- 要点:XDP 在驱动层(最靠前钩子)丢弃/限速恶意包,可达线速;eBPF map 统计每流 PPS/字节、检测微突发(microburst)与异常 elephant flow;结合 in-band telemetry 把 per-queue 微突发推到 Grafana。Cilium 的 eBPF 数据面已用于生产级 Service LB 与 L3-L7 策略,是"零侵入可观测 + 高性能数据面"的代表。

【新增·2025】▶ NVIDIA DOCA / NetQ 在 AI fabric 运维中的角色? 可观测/运维 · 进阶
- 要点:DOCA 是 BlueField DPU 上的开发框架,把存储/安全/遥测卸载到 DPU;NetQ 是网络校验与遥测平台,可对 Spectrum-X fabric 做全网一致性检查、拥塞/丢包/配置漂移的实时诊断。面试加分:能讲清"为什么把运维逻辑放进 DPU/NIC 而非主机 CPU"。

04 · Windows 网络 & Internals

▶ WFAS 与 Linux iptables 模型异同?PowerShell 批量配置? Windows · 进阶 ——(New-NetFirewallRule -DisplayName "Allow-SSh" -Direction Inbound -Protocol TCP -LocalPort 22 -Action Allow;WFAS 基于配置文件+入站/出站规则+块优先于允许,默认阻止入站、更"对象化")。
▶ Windows 与 Linux 混部常见跨平台网络问题? 混合 · 进阶 ——(MTU 不一致、时间同步 Kerberos/AD 依赖 NTP、SMB 签名、名字解析顺序 DNS vs NetBIOS、防火墙默认策略不同;Test-NetConnectionGet-NetTCPConnection、Wireshark)。
▶ Windows 端口/连接/Socket 级诊断? 诊断 · 基础 ——(netstat -ano/Get-NetTCPConnectionTest-NetConnection -Portnetsh traceGet-NetIPConfigurationResolve-DnsName)。
▶ NTFS/Windows ACL 与 Linux 文件权限差异?域环境统一安全策略? 安全 · 进阶 ——(Windows DACL+SACL 基于 SID 可继承细粒度;Linux owner/group/other + rwx + ACL;域用 GPO 统一防火墙/审计/密码策略;Linux 侧 FreeIPA/AD 集成 SSSD)。

【新增·2025】▶ 在 GPU 训练集群里,Windows 节点一般承担什么角色?与 Linux 计算节点的网络如何协同? 混合 · 进阶
- 要点:AI 训练计算节点几乎全是 Linux(CUDA/NCCL/Spectrum-X 生态),Windows 多出现在带外管理、AD 域控、SMB 共享存储网关、监控/跳板等辅助面。关键是把 Windows 面与 Linux 计算面VLAN/物理隔离,并统一 NTP(AD 域控常作时间源)、统一 DNS 与日志。混部风险:SMB 签名与 MTU 不一致、NetBIOS 名解干扰,可用 GPO + 独立管理 VLAN 收敛。

05 · 常见协议:DHCP / DNS / TLS

▶ DHCP 四次交互?DHCP Snooping 作用? DHCP · 基础 ——(DISCOVER→OFFER→REQUEST→ACK;Snooping 只信信任口上联 DHCP 服务器,非信任口 OFFER 丢,防私接/欺骗,建绑定表供 DAI/IPSG)。
▶ DNS 解析完整链路?递归/迭代区别?内部如何用 DNS 做服务发现? DNS · 进阶 ——(解析器→根→TLD→权威;递归 vs 迭代;内部权威 DNS + SRV 记录 + Consul/etcd;TTL 设计与 DNSSEC)。追问:Kaminsky 缓存投毒与 DoH/DoT 防护。
▶ TLS 握手(1.2 vs 1.3)?内部为何常做 mTLS? TLS · 专家 ——(1.2 需 2-RTT,1.3 简化 1-RTT(+0-RTT);内部 mTLS 服务间双向认证+加密防东西向横向移动,常见于 service mesh;提证书轮换、私有 CA)。
▶ 节点无法解析域名但能 ping IP,如何定位? 排障 · 基础 ——(Linux:cat /etc/resolv.confdig @8.8.8.8 example.comsystemd-resolve --status;Windows:nslookupipconfig /displaydns;看 resolv.conf 指向、53 端口可达、systemd-resolved 配置)。

【新增·2025】▶ 在 AI 数据湖与对象存储场景,为什么 HTTPS/S3 前端越来越依赖 TLS1.3 与 QUIC? TLS/传输 · 进阶
- 要点:训练数据从对象存储(S3/MinIO/Ceph RGW)拉取,海量小文件随机读对延迟敏感;TLS1.3 的 1-RTT(及 0-RTT 复用)与 QUIC 的多路复用无队头阻塞显著降低首字节延迟,且 QUIC 连接迁移适配容器漂移。安全侧:内部 S3 gateway 常配 mTLS + 私有 CA 做租户隔离。

06 · 存储栈:Lustre / GPFS 与新兴技术

▶ Lustre 架构(MGS/MDT/OST/MDS/OSS/Client)与各组件职责。 Lustre · 专家 ——(MGS 配置;MDS+MDT 元数据;OSS+OST 数据条带化;Client 挂载;性能来自跨 OST 并行)。追问:striping(stripe_count/size)如何影响 checkpoint 读写——大文件/高并发读宜大 stripe_size+多 OST;checkpoint 写条带跨 OST 并行加速;海量小文件 stripe_count=1 避免热点;lfs setstripe 按目录/文件设定。
▶ GPFS 与 Lustre 核心差异? GPFS · 专家 ——(GPFS IBM 商业、POSIX 完整、强一致、多协议;Lustre 开源、极致吞吐、元数据可能瓶颈;大顺序读→Lustre/NVMe,多协议企业→GPFS/WEKA)。
▶ NVMe-oF 是什么?为何替代 iSCSI/NFS 用于 AI? NVMe-oF · 专家 ——(NVMe over Fabrics 把本地 NVMe 命令扩到网络,延迟近本地;AI checkpoint/数据加载 I/O 密集,传统 NFS/iSCSI 开销大 → NVMe-oF(RoCE) 降延迟)。追问:本地 NVMe vs 网络 NVMe-oF vs 对象存储 S3——本地最低延迟难共享;NVMe-oF 低延迟+池化;S3 高扩展低成本最终一致,适合冷数据/数据湖;典型:S3 数据湖 → 并行 FS/NVMe-oF/缓存层(Alluxio/JuiceFS) → 喂 GPU。
▶ AI 训练 I/O 慢,如何判断瓶颈在存储/网络/计算? 排障 · 专家 ——(分层测:① nvidia-smi dmon GPU 是否空等;② fio 本地盘基线;③ iperf3/ib_write_bw RDMA 带宽;④ lctl/gpfs OST 负载均衡/条带;⑤ top/atop CPU wa%;结合 Prometheus/Grafana 队列深度与延迟)。
▶ 对象存储(S3/MinIO/Ceph)在 AI 数据湖中的角色? 对象存储 · 进阶 ——(海量非结构化、低成本、易扩展;POSIX 弱、随机小文件慢;并行 FS 适合训练期高吞吐;S3 + 缓存层喂训练)。
▶ Ceph 的 RADOS/RBD/CephFS? Ceph · 进阶 ——(RADOS 底层对象;RBD 块;CephFS POSIX;RGW S3;统一存储但调优复杂;极致性能仍偏 Lustre/NVMe)。
▶ WEKA / DAOS 等新一代并行存储特点? 新存储 · 专家 ——(WEKA 元数据/数据分布到客户端与存储节点、NVMe+RDMA、POSIX+S3 双协议、云边一体;DAOS Intel SCM+NVMe、对象键值、零拷贝、RDMA,面向 Exascale)。追问:与 Lustre 共存/迁移——分层并存,Lustre 承存量大文件,WEKA/DAOS 承元数据密集/低延迟新负载;用网关/并行拷数据迁移;以统一命名空间(JuiceFS/CSI) 屏蔽差异。

【新增·2025】▶ 如何为训练 checkpoint 风暴(10–20 Tbps 写突发)设计存储? 存储性能 · 专家
- 要点:checkpoint 是周期性全集群同步落盘,产生突发写尖峰,不能按平均带宽设计。手段:① 存储控制器用 HBM/DRAM 写缓冲吸收突发;② 多 OST/多存储节点条带化打散;③ 训练侧用异步 checkpoint + 分级(高频→本地 NVMe,低频→并行 FS);④ 用 lfs setstripe、WEKA/DAOS 的分布式元数据避免单 MDS 瓶颈;⑤ 监控 MOPS(元数据 ops/s)而非只看带宽。

【新增·2025】▶ IO500 榜单(SC25)说明了什么?DDN/WEKA/DAOS/Vast 怎么选? 存储基准 · 专家
- 要点:IO500 是并行文件系统标准基准(顺序/随机带宽、元数据、find)。SC25(2025-11) 10-节点生产榜:DAOS(Argonne/LRZ) 2885/1008 领跑,DDN EXAScaler 348,WEKA 106;pNFS 最快 NFS 结果也仅 18 名,说明"真并行 FS"与"NFS 扩展"架构差距巨大(领先者快 19×)。选型:极致元数据/小文件与 Exascale → DAOS;云边一体双协议 → WEKA;传统 HPC 大文件 → Lustre/DDN;NFS(pNFS) 适合非训练热路径。

【新增·2025】▶ BeeGFS 在 AI 训练中的定位?与 Lustre/WEKA 的差异? 存储选型 · 进阶
- 要点:BeeGFS 开源、对称服务(元数据/存储分离)、内核客户端、RDMA 优先,易起、易运维,适合中大型训练(~千节点级);但默认云本地 SSD 无持久化(R-1 条带一损俱损),buddy mirroring(2×) 才补冗余。对比:Lustre 50k+ 节点规模最强但运维难;WEKA 全分布式易运维、云原生;DAOS 元数据/IOPS 天花板最高。面试加分:能按规模/运维成熟度/SLA 选 FS。

07 · HPC & AI 基础设施技术

▶ GPU 互联(NVLink / NVSwitch / PCIe)分别解决什么? GPU · 专家 ——(PCIe Gen5 ~64GB/s/link 有限;NVLink 数百 GB/s 直连;NVSwitch 多 GPU 全互连(DGX);训练参数/梯度频繁同步,PCIe 成瓶颈 → 需 NVLink + 节点间 InfiniBand(GPUDirect RDMA))。(2025 深化) 第五代 NVLink 达 1.8 TB/s/GPU 双向、NVL72 域 130 TB/s、可扩至 576 GPU/1 PB/s;GB200 NVL72 整柜液冷,训练较 H100 4×、推理 30×。

▶ InfiniBand 与 RoCE 如何选型?GPUDirect RDMA / GPUDirect Storage? 互联 · 专家 ——(IB 专用无损最低延迟、生态成熟;RoCEv2 复用以太网省一张网但需无损;GPUDirect RDMA 显存经 NIC 直出跳过 CPU;GPUDirect Storage 存储直送显存)。(2025 深化) IB 小消息延迟 0.6–1.0µs@200G,RoCEv2@400G 1.5–2.5µs 但单端口成本低 35–50%;2025 年 62% 超大规模新集群用以太网 fabric。

▶ MPI 与集合通信(AllReduce/Broadcast/AllGather),NCCL 的作用。 通信 · 专家 ——(AllReduce 是分布式训练核心;NCCL 针对 GPU/IB/NVLink 优化,自动选环/树)。追问:Ring vs Tree AllReduce——Ring 2(N-1) 步、带宽最优易扩展、延迟随 N 线性;Tree 延迟 O(log N)、对拓扑敏感;NCCL 按 GPU 数/链路/消息大小自动选,借 NCCL_ALGO/NCCL_PROTO 微调,利用 intra-node NVLink + inter-node IB。

▶ 设计支撑千卡 GPU 训练的集群网络(计算/存储/管理网)? 架构设计 · 专家 ——(三网/多网隔离:① 计算网 IB/RoCE 无损、leaf-spine、rail 优化;② 存储网 并行 FS + NVMe-oF 独立带宽;③ 管理/带外(BMC/IPMI)独立;地址/VLAN 规划、PTP 时钟同步、telemetry、故障域隔离;ECMP、无阻塞、可观测)。

▶ 什么是 NUMA?AI 服务器为何关注 NUMA 亲和性? NUMA · 进阶 ——(跨 socket 内存延迟高;GPU/网卡附着某 NUMA,进程/中断应绑同节点;numactl/lscpu/hwloc/irqbalance)。

▶ CXL 对 AI 基础设施的意义? CXL · 专家 ——(Compute Express Link 是 CPU/加速器/内存/设备缓存一致性互联;内存池化扩展(CXL.mem 缓解 HBM 容量)、加速器互联(CXL.cache)、资源解耦;对大模型内存墙/碎片化有价值)。追问:与 NVLink/PCIe 互补为主——PCIe 通用底座、NVLink 机内 GPU 专网、CXL 在标准层提供内存语义与一致性,弥补 NVLink 厂商封闭;短期 NVLink 主导 GPU 间,CXL 进内存扩展与异构设备。

▶ 如何做训练任务的网络拓扑感知(NCCL_TOPO / 拓扑文件)? 通信调优 · 进阶 ——(NCCL 默认探 NVLink/PCIe/IB;NCCL_TOPO_FILE 提供自定义拓扑避开跨 NUMA/跨交换机;NCCL_GRAPH/NCCL_ALGO 调优;nccl-tests(all_reduce_perf) 验证收益)。

【新增·2025】▶ 解释 NVIDIA Spectrum-X 的"自适应路由 + 接收端重组"如何解决 ECMP 哈希极化? 网络传输 · 专家
- 要点:传统 ECMP 在连接建立时把整流钉在一条路径,incast 下严重失衡(部分链路满、部分空)。Spectrum-X 逐包选路:Spectrum-4 交换机实时评估各出端口拥塞,选最空端口;交换机间交换拥塞状态,决策还考虑下游拥塞。逐包会乱序,故 BlueField-3/ConnectX-8 在 NIC 内做接收端重组,对 RDMA/应用透明。效果:AI 训练有效利用率从 50–60% 抬到 >97%,xAI Colossus 十万卡实测 95% 吞吐、零碰撞丢包。

【新增·2025】▶ SHARP(可扩展层次化聚合归约协议)是什么?以太网侧现在能做吗? In-Network Computing · 专家
- 要点:SHARP 让交换机在网内做 all-reduce 等归约计算,减少端到端通信量。原是 InfiniBand 特性;2025 ConnectX-8 把 SHARP v4 带到 Spectrum-X 以太网侧,支持在以太网 fabric 上做 in-network all-reduce,是 NVIDIA 把 IB 能力向以太网迁移的标志。面试加分:能讲清 in-network computing 如何降低 JCT。

【新增·2025】▶ 端到端 GPU 到 GPU 的延迟预算怎么拆?哪些环节最容易被忽视? 性能分析 · 专家
- 要点:延迟链 = NIC→PCIe/NVLink-C2C→GPU 显存 + 网络传播 + 交换机排队 + 协议处理。最易被忽视:① NUMA 错位(GPU 与 NIC 不在同一 NUMA,跨 socket PCIe 多跳);② PFC pause 风暴导致整 fabric 微秒级抖动;③ incast 微突发在 400G/800G 下缓冲几微秒即满;④ 主机端中断未绑核。定位用 nvidia-smi dmon + ibstat + 每队列 ECN/pause 计数 + nccl-tests

08 · 自动化 & 工具链

▶ Ansible 架构与核心概念?优劣势? Ansible · 进阶 ——(无 agent(SSH)、YAML playbook、幂等、模块化;易上手但大规模性能弱,可加 mitogen/awx)。追问:handler/vault/动态 inventory——handler 收尾动作避免每次重启;vault 加密敏感变量;动态 inventory 从 CMDB/云/K8s 拉清单;roles/tags/--check --diff/fact caching。

▶ Ansible 与 Puppet/Salt 本质区别? 选型 · 进阶 ——(Puppet agent+master 强状态收敛;Salt 事件驱动实时;Ansible 推式无 agent 编排。常混用:Ansible 部署编排,Puppet/Salt 配置合规)。

▶ Python 脚本:批量检测交换机/服务器端口连通性与延迟并生成报告。 Python · 进阶 ——(paramiko/netmiko 连设备、asyncio/线程池并发、subprocess 调 ping/ssh,结果汇总 Pandas→HTML/CSV;错误处理/超时/并发上限/幂等/日志;可提 Nornir)。

▶ Git + CI 对网络/基础设施配置做版本管理与变更审计? IaC · 进阶 ——(配置即代码入库;PR review;CI 跑语法检查/干跑;变更可追溯回滚;GitOps、Terraform 管云/裸金属、Ansible 应用配置;变更窗口+审批+回滚预案)。

▶ 大型集群可观测性(监控/日志/告警)?用过哪些栈? 可观测 · 专家 ——(Prometheus + node_exporter/snmp_exporter + Grafana;日志 ELK/Loki;网络遥测 sFlow/NetFlow/gNMI;告警 Alertmanager;AI 集群加 DCGM-exporter(GPU)、IB 计数器;SLO/基线/容量规划)。

▶ 讲一次用自动化把"数小时人工"缩短到"分钟级"的经历。 实战 · 进阶 ——(STAR:重复/易错→Ansible/脚本→4h→15min、错误率降、可回滚;"脱颖而出"典型题,备 1–2 案例)。

▶ Terraform 在 IaC 中的角色?与 Ansible 分工? IaC · 专家 ——(Terraform 声明式管资源生命周期(建/改/删,状态锁),擅长云/网络/裸金属(交换机/子网/LB);Ansible 管配置与编排(装软件/改文件/启服务);典型:Terraform 拉底层 → Ansible 配 OS/应用)。追问:检测修复配置漂移——terraform plan 对比状态文件与真实资源、Ansible --check --diff、外部合规扫描(Chef InSpec);以代码为真相源收敛,禁手工改生产,CI 强制 plan 评审+漂移告警。

【新增·2025】▶ 在 SONiC/白盒 + Terraform + Ansible 的 GitOps 流水线里,如何保证千节点网络配置的可审计与可回滚? IaC/运维 · 专家
- 要点:Config DB(Redis) 即代码 → Git 入库;Terraform 管 underlay(交换机/ZTP/子网/AS),Ansible 管overlay(EVPN/VXLAN/RoCE 参数);CI 跑 sonic-cli 语法校验 + terraform plan + Ansible --check --diff;变更走 PR + 审批 + 回滚预案;状态漂移用 Telemetry(GNMI) 持续比对。加分:能讲"白盒 + GitOps"相比传统 NOS 的 TCO 与风险权衡。

【新增·2025】▶ 如何用 Nornir + Netmiko 做大规模交换机配置的并发校验? Python/网络自动化 · 进阶
- 要点:Nornir 是 Python 原生网络自动化框架,比 Ansible 更适合写复杂逻辑;用 nr.run() 并发对上千台设备跑 netmiko 命令(如 show interfaceshow priority-flow-control),结果进结构化字典 → Pandas/JSON → 生成合规报表;要点:连接超时、并发上限(防压垮设备)、错误隔离、幂等。这是"数小时→分钟级"的硬核案例素材。

09 · R&D / POC / POV 与跨团队协作

▶ 描述一次 POC/POV:目标、评估维度、如何说服 stakeholder? POC · 进阶 ——(明确假设与成功标准(吞吐/延迟/成本/TCO);设计基准(iperf3/MLPerf/fio);对照组;数据驱动;ROI/风险对比给采纳/放弃建议;把技术语言翻成业务价值)。

▶ 新存储/网络技术 POC 中设计可复现基准测试? 基准 · 专家 ——(固定变量(硬件/OS/驱动/负载模型);多轮取中位数+方差;模拟真实 AI 负载(checkpoint 写、随机读、顺序读);记录环境清单;容器化基准自动复跑;避免"跑分陷阱")。

▶ 如何与硬件/软件/研发团队协作优化集群网络健康? 协作 · 进阶 ——(共享指标仪表盘;定期联合复盘(postmortem);数据驱动("GPU 利用率低 30% 因 IB 重传");定义接口契约(网络 SLA、存储 IOPS);推动自动化减手工扯皮)。

▶ 研发要求"短期 hack"破坏网络最佳实践,如何处理? 权衡 · 进阶 ——(不硬挡:理解急迫性;提供带时限、可控、可回滚折中;记技术债与风险;到期复盘;"赋能而非阻碍")。

▶ 如何把 POC 结果转化为可落地生产标准(runbook/SOP)? 落地 · 进阶 ——(POC 结论→部署清单、参数基线(sysctl/交换机模板)、验收标准、监控指标与告警阈值、回滚预案;runbook/SOP 入库+培训;IaC 固化避免"实验态"回手工)。

【新增·2025】▶ 如何为一个"Blackwell + Spectrum-X 800G"新集群设计验收 POC(含 RoCE 无损与拓扑感知)? POC/基准 · 专家
- 要点:① 无损验证:iperf3/ib_write_bw 打满 800G,监控 PFC pause 帧趋零、ECN 标记率、RoCE 重传率;② 集合通信基准nccl-tests all_reduce_perf 对比不同 NCCL_TOPO_FILE/rail 的收益;③ 微突发与自适应路由:注入 incast 看 Spectrum-X 自适应路由把利用率维持 >90%;④ 故障注入:拔链/瘫 spine 看 ECMP 重映射与 JCT 影响;⑤ 能效:GB200 NVL72 液冷 PUE 实测。所有结果进 runbook 基线。

10 · 软技能 & 行为 / 知识转移

▶ 大集群故障中如何确定优先级并独立推动解决? 软技能 · 进阶 ——(影响面/严重性排序;快速止血(隔离/降级);并行排查;同步干系人;事后复盘;"主动 owner + 沟通")。
▶ 做过哪些知识转移(handover/培训)? 知识转移 · 基础 ——(runbook/架构图/故障手册;录屏+文档;内部 workshop;代码配置入库可读;on-call 交接清单;"可转移、可复现")。
▶ "技术能力 + 人际能力"如何让你脱颖而出?举例。 软技能 · 进阶 ——(跟研发讲清网络限制、跟老板讲清成本/风险、跟客户建信任;把事故转跨部门改进+对外透明沟通)。
▶ CCNP 之外持续学习的方式?最近研究的新技术? 成长 · 基础 ——(RFC/厂商文档/实验室/开源/社区;备一个"最近学的东西"如 UEC/超以太网、SONiC、DPU、CXL 并讲清原理与价值)。


三、新增能力域

11 · 供电与液冷(Power & Liquid Cooling)——2025–2026 最关键的新变量

随着单机柜突破 100 kW,供电与散热已从"附属工程"变成与网络、计算并列的核心设计约束。

▶ 为什么 AI 机柜必须上液冷?风冷的物理极限在哪里? 液冷 · 专家
- 要点:风冷在 ~30–50 kW/柜即触顶(需超大风机功率、热点、节流 GPU)。GB300 NVL72 整柜 130–142 kW、Vera Rubin NVL72(2026)230–300 kW、Rubin Ultra(2027 路线图)高达 600 kW;Google 已公开讨论 1 MW/柜。NVIDIA 明确要求 GB200/GB300 为全液冷基线,实际上强制 DLC(冷板直冷)
- 追问:液冷渗透率——数据中心整体 2024 约 14% → 2025 约 33% → 2026 AI 芯片约 47%;液冷 PUE 可降至 1.15(风冷通常 1.5+)。中国政策要求 2026 新建 DC 液冷 ≥60%、枢纽节点 PUE ≤1.2 且液冷 ≥70%。

▶ 直接液冷(DLC)、后门换热器、浸没式各适合什么场景? 液冷架构 · 进阶
- 要点:DLC(冷板贴 GPU/CPU,CDU→设施环路)100–300+ kW,前沿训练首选(2026 占 AI 液冷 ~47%);后门换热器 30–60 kW,棕地改造桥接;浸没式极高密度,专业 HPC/新建 pod。供水 45℃ 温水直冷 + 干冷器可免压缩机制冷,接近零水耗闭环。

▶ 一个 GW 级 AI 园区(如 xAI Colossus / Meta Prometheus)的供电如何组织? 供电 · 专家
- 要点:GB200 NVL72 单柜约 1.36 吨、峰值 120–140 kW;GW 级园区需专用变电站 + 自备燃气轮机/移动发电机 + 电池(Megapack)平滑负载。xAI Colossus 用 35 台移动发电机(达 420 MW) + Tesla Megapack 补网电滞后,从 15 MW 扩到 >250 MW 再到目标 2 GW。要点:电网成"守门人",选址先看电再看地(德州 ERCOT 因快速互联/充沛土地/去管制成 2026 全球第一数据中心市场)。

▶ 液冷改造棕地(brownfield)数据中心的主要挑战? 运维 · 进阶
- 要点:① CDU/管路/漏检改造资本高(液冷单位投资 322.8 元/W vs 风冷 266.8 元/W,但全生命周期 TCO 更优);② 改造周期比预期长(2025 抽样 87 个项目平均延迟 30%);③ 水效(WUE)成选址指标(48% AI 租户纳入);④ 运维需新技能(液冷泄漏、CDU 冗余泵)。优先绿地主导流温水 DLC 避免两代内二次改造。

▶ 如何把 PUE/WUE 纳入 AI 集群的 SLO 与容量规划? 能效 · 专家
- 要点:PUE 1.15 的液冷 vs 1.5 风冷,同样 IT 负载电费差 ~30%;把 PUE 当作与 GPU 利用率并列的运营 KPI;容量规划按"每 kW 算力 + 每 kWh 成本 + 碳/水约束"三维评估;闭环液冷 + 余热回收(供暖)成新设计共识。

12 · 真实大模型集群案例(Real-World AI Clusters)——面试"讲案例"加分项

能用真实规模与架构讲清决策,是区分资深与普通的标尺。

▶ xAI Colossus 是怎么在 122 天内建起 10 万卡 H100 的?它证明了什么? 集群案例 · 专家
- 要点:2024-05→09 在孟菲斯旧伊莱克斯工厂改造,10 万 H100 上线;靠 35 台移动发电机 + Megapack 补电网滞后;到 2026 初扩至 ~55.5 万 GPU(H100/H200/GB200 混合)、目标 2 GW、成本约 $18B、目标 100 万卡。证明:① 供电/制冷是瓶颈而非芯片;② 十万卡可作为"一块巨 GPU"协同(一致性突破);③ Spectrum-X 以太网在十万卡上实测 95% 吞吐、零碰撞丢包。

▶ OpenAI Stargate / Meta Prometheus / Hyperion 的架构共性是什么? 集群案例 · 专家
- 要点:参考架构高度标准化——NVIDIA GB200 NVL72 整柜(72 GPU, 液冷) + 高基数以太网或 InfiniBand fabric + 专用变电站 + 自备发电。Stargate(Abilene) 目标 ~1.2 GW/8 栋,$500B 计划 2029 年 ~10 GW;Meta Prometheus(俄亥俄) ~50 万 GPU/1.02 GW;Hyperion 多 GW。共性:网络成为"AI 工厂操作系统",性能前沿从计算转向连接。

▶ 为什么 2025 年以太网 fabric 在超大规模反超 InfiniBand? 架构趋势 · 专家
- 要点:2025 年 62% 新 GPU 集群用以太网(2022 仅 41%)。动因:① RoCEv2 单端口成本低 35–50%;② 复用以太网专家、开放多厂商避免锁定;③ Spectrum-X/UEC 把以太网无损与利用率做到接近 IB;④ Meta/Oracle/Google Cloud/Microsoft/Azure/CoreWeave/xAI 均选 Spectrum-X 或 RoCE。IB 仍在最大/最苛集群保有用武,但以太网"追上"已成定局。

▶ 跨园区多数据中心训练(如 Stargate 多站点)网络怎么设计? 跨 DC · 专家
- 要点:用长距光纤 + 容错把多个 GW 园区连成逻辑集群;关键是故障域隔离 + 长传带宽 + 一致性/JCT 容忍;SpectrumXGS 更把多 DC 甚至跨国连成单一逻辑 AI 系统。挑战:长传 RTT 大,集合通信需异步/分层(intra-DC 高频、inter-DC 低频同步)。

13 · DPU / SmartNIC 与加速器互连新标准

2025–2026 网络"下沉到 NIC/DPU"与互连标准开放化是两条主线。

▶ 什么是 DPU / SmartNIC?在 AI 工厂里承担什么角色? DPU · 专家
- 要点:DPU 是把网络/存储/安全从主机 CPU 卸载的"云基础设施处理器"。NVIDIA BlueField-3 跑拥塞控制(每秒百万级事件、微秒反应)、包重组、存储/安全/遥测卸载,释放 CPU 给 AI;SuperNIC(如 ConnectX-8 800Gb/s)专管东西向 GPU↔GPU 流量,DPU 管南北向(存储/租户/安全)。AWS Nitro、Azure Boost 同理把基础设施逻辑移出主机。

▶ NVIDIA Spectrum-X 的 SuperNIC vs 传统 NIC 差异? SmartNIC · 进阶
- 要点:BlueField-3 SuperNIC 含 Arm 多核,在 NIC 内跑拥塞控制与接收端重组,使自适应路由对应用透明;ConnectX-8 双带宽(800G)、PCIe Gen6、带 SHARP v4 把 in-network all-reduce 带到以太网。意义:网络智能从交换机扩展到端点,是实现 >97% 利用率的工程关键。

▶ UALink 与 UEC 分别解决哪一层?和 NVLink/InfiniBand 什么关系? 互连标准 · 专家
- 要点UALink = 开放 scale-up(柜内/机内多加速器缓存一致与内存语义),对标 NVLink 的封闭;UEC = 开放 scale-out 以太网传输(UET),对标 InfiniBand 的封闭 + RoCE 的 PFC 脆弱性。分层:scale-up(NVLink/UALink) 低延迟紧耦合;scale-out(IB/RoCE/UEC) 跨节点。2025 UEC 1.0 发布、UALink 联盟成形,标志 AI 互连从"厂商专有"走向"开放标准+多厂商"。

▶ 为什么 AWS EFA 是云原生 RDMA 的另一种答案? 云 RDMA · 进阶
- 要点:AWS EFA 用可扩展可靠数据报(SRD) 在 AWS fabric 上提供 RDMA 语义,终止在 Nitro 卡而非主机 CPU(GPU 显存→Nitro→网络),免运维 IB/RoCE。P4d(A100)/P5(H100) 含 EFA,聚合 400G–3200G。云上训练直接选 EFA,底层选择由云厂商做。


四、让面试官记住你的"脱颖而出"清单(2025–2026 更新)

① 能画并解释 leaf-spine + 三网隔离 + rail-optimized 的整体架构图;
② 讲清 RDMA/RoCE 无损网络与 PFC/ECN/DCQCN 调优的实战坑,以及 UEC 1.0 为何不依赖 PFC
③ 展示 Lustre/GPFS/NVMe-oF/WEKA/DAOS 调优与 I/O 瓶颈(含 checkpoint 风暴、IO500)定位的真实案例;
④ 拿出 Ansible/Nornir/Terraform + GitOps(SONiC) 自动化从小时到分钟的量化成果;
⑤ 用 GPU-NIC-InfiniBand/NVLink 5-CXL-NUMA 全栈视角谈训练性能(含 1.8 TB/s NVLink、130 TB/s 域);
⑥ 体现"既懂底层网络、又能跟研发/客户对话"的软硬结合;
⑦ 能讲清 Spectrum-X 自适应路由、SONiC/白盒、eBPF、WEKA/DAOS、拓扑感知、液冷供电、真实万卡集群(xAI/Meta/Stargate) 等前沿方向;
(新增) 能脱口而出量级:GB300 整柜 130–142 kW 全液冷、Vera Rubin 300 kW、Tomahawk 6 102.4 Tbps/1.6T、UEC 1.0(2025-06)、xAI Colossus 55.5 万卡/2 GW、以太网 fabric 占比 62%。


五、参考来源(深度研究 · 公开资料 2025–2026)

本扩充版在原始题库基础上,依据上述公开资料补充事实、量化指标与前沿题。建议配合动手实验(GNS3/EVE-NG、真机实验室、KVM+netns、SONiC 虚拟机、NCCL-tests)加深理解。祝面试顺利 🚀

本文件由 WorkBuddy 基于资料库原始题库(AI_Data_Center_Interview_Questions)做 2025–2026 深度研究扩充后生成。建议配合动手实验加深理解。