1. 为什么需要太空算力——轨道数据中心的技术动机

1.1 数据下行瓶颈:物理带宽的天花板

低轨遥感卫星(如高分系列、Planet Doves、SkySat)单星每天生成原始数据量典型在 0.5–2 TB 之间,高分辨率 SAR 卫星(如 Capella、TerraSAR-X)单星可达 5 TB/天以上。下行链路受限于三重物理约束:

  • 频谱资源:X 波段(8–12 GHz)受限,Ka 波段(26–40 GHz)雨衰严重,且需国际电联(ITU)协调
  • 地面站几何覆盖率:单星每天可见单一地面站窗口通常仅 4–6 个,累计过顶时间约 10–15 分钟
  • 链路速率上限:当前主流 X 波段下行 500–800 Mbps,Ka 波段可达 1–3 Gbps

理论计算:以 1 Gbps 下行速率、每天 12 分钟可见窗口计算,单星日下行能力约:

1 Gbps × 12 × 60 s = 720 Gbit ≈ 90 GB

而数据生成量普遍在 500 GB 以上,下行缺口达 5 倍以上。即便部署多地面站也无法根本解决,因为瓶颈在频谱与轨道几何,而非地面设施。这正是"算力下沉"的根本驱动力——既然数据送不下来,那就把算力送上去。

1.2 算力下沉:边缘计算在轨道的延伸

地面云计算模型中,"数据向算力流动"是默认假设。但在太空场景下:

  • 数据生成源(卫星载荷)在轨
  • 数据消费者(遥感分析、气象、灾害响应、军事应用)部分在地面、部分在轨
  • 链路时延(LEO 单跳 10–40 ms,含星地处理可达 100–200 ms)与带宽成本高

因此合理方向是"算力向数据流动"——在轨道上完成数据预处理、特征提取、模型推理,仅将高价值结果(而非原始数据)下行。这与地面"边缘计算"思想一脉相承,但工程约束从"低延迟"变为"低带宽、低能耗、高可靠、抗辐照"。

任务下沉的典型收益估算:

  • 原始遥感图像(500 MB/景)→ 目标检测结果(5 MB/景),数据量压缩 100 倍
  • 视频流实时分析:原始 4K 视频 800 Mbps → 检测元数据 1 Mbps,压缩 800 倍

1.3 PUE 悖论:太空散热的劣势与机遇

地面大型数据中心 PUE 约 1.2–1.5,主要额外能耗来自冷水机组、CRAC 空调、风扇。太空环境下 PUE 概念需要重新定义——不再是"冷却能耗/算力能耗",而是"辐射器面积/算力功耗"。

维度 地面数据中心 太空算力节点
主散热机制 蒸发冷却/风冷(对流主导) 热辐射(无对流)
环境温度 约 300 K(受限于当地气候) 深空背景约 3 K
散热能力密度 50–100 W/cm²(液冷板) 300+ W/cm²(液冷板),但终态辐射受限
冷源 江河/海水/冷却塔 深空 3 K 黑体
额外能耗 高(压缩机、泵、风扇) 低(仅循环泵)

劣势:真空无对流,所有废热必须以辐射形式排出(Stefan-Boltzmann 定律限制);辐射散热能力随温度的四次方变化,温度越高散热越强,但器件温度上限约束严苛。

机遇:深空背景温度约 3 K,是天然的极低温热沉;无大气衰减,辐射散热效率理论上很高。

这使得太空数据中心存在一个有趣的"反向优化":提高散热面温度反而有利于辐射散热(Q ∝ T⁴),这与地面"降温即散热"的直觉相反。优刻得样机的核心创新正是在此:将太阳能板背面复用为辐射散热面,让服务器废热通过较高温度的辐射面排出。

1.4 算力星座的演进路径

阶段 时间 特征 代表
单星边缘 AI 2020–2024 MyRIAD/低功耗 SoC,处理特定任务 D-Orbit、ESA Φ-sat-1/2
算力卫星 2025–2027 搭载 FPGA/中端 GPU,多任务 国星宇航+商汤"商汤号"
算力星座 2028–2030 千颗级组网,万 P 级总算力 国星宇航规划、Starlink V2
星地混合云 2030+ 在轨与地面算力统一调度 优刻得"星图"平台

1.5 行业趋势对比

项目 国家 算力规模 散热方式 能源 时间节点
国星宇航+商汤"商汤号" 中国 千颗级,万 P+ 未公开(推测液冷+辐射) 光伏+电池 2026 首发,2030 建成
优刻得+上理工样机 中国 样机(顶级 GPU) 闭环液冷+辐射 光伏+储能 2026 样机
Starlink V2/V3 美国 星间处理为主 被动辐射 光伏+电池 2023 起
Microsoft Azure Space 美国 地面+少量星载 地面为主 电网 2020 起
HPE Spaceborne Computer 美国 单台服务器(ISS 内) 风冷(舱内大气) 空间站供电 2017–2021
ESA Phi-Sat-1/2 欧洲 单星 AI 加速器 被动辐射 光伏+电池 2020/2022

2. 太空算力样机系统三层架构

2.1 架构总览

优刻得样机系统采用三层紧耦合架构,每一层既是上层的服务提供者,又是下层的负荷施加者,形成"算力-电力-热力"三角耦合:

┌──────────────────────────────────────────────────────────────┐
│                  算力与核心控制层                              │
│   ┌──────────────┬──────────────┬──────────────┐            │
│   │  GPU推理引擎  │ 遥感图像处理  │ 数字孪生仿真  │            │
│   └──────────────┴──────────────┴──────────────┘            │
│   ┌──────────────────────────────────────────┐              │
│   │     多物理场数值模拟 (CFD / FEA / EM)      │              │
│   └──────────────────────────────────────────┘              │
│   全液冷 GPU 模组 · "星图"平台推理一体机 · 任务调度器            │
├──────────────────────────────────────────────────────────────┤
│                  电源与能源管理层                              │
│   ┌──────────┐    ┌──────────┐    ┌──────────┐              │
│   │ 光伏电池  │───→│ MPPT控制 │───→│ 储能电池  │              │
│   │ (正面)   │    │  器      │    │   组     │              │
│   └──────────┘    └──────────┘    └──────────┘              │
│   背面:液冷管道 + 高发射率辐射涂层                            │
│   母线:28V/100V DC · 充放电管理 · 阴影期切换                  │
├──────────────────────────────────────────────────────────────┤
│                  散热与流体循环层                              │
│   ┌─────────┐    ┌─────────┐    ┌─────────┐                 │
│   │ 循环泵   │───→│ 服务器  │───→│ 太阳能板 │                 │
│   │(高可靠) │    │ 液冷板  │    │ 背面管道 │                 │
│   └─────────┘    └─────────┘    └─────────┘                 │
│                       │                                      │
│                  ┌─────────┐                                  │
│                  │ 辐射换热器│←── 传感器网络(T / 流量 / 压力)  │
│                  └─────────┘                                  │
└──────────────────────────────────────────────────────────────┘

2.2 算力与核心控制层

职责:执行 AI 大模型推理、遥感测绘图像实时处理、数字孪生仿真、多物理场数值模拟(CFD/FEA/EM)。

关键技术解析

  • 全液冷 GPU 模组:相比风冷,液冷冷板可将芯片结温降低 15–25°C,热流密度从风冷的 ~50 W/cm² 提升至 300 W/cm² 以上。这直接支撑顶级 GPU(如 H100/B200 级别,单卡 700–1000 W TDP)在轨运行。冷板通常采用微通道结构(通道宽度 100–300 μm),换热系数可达 10⁴–10⁵ W/m²·K。

  • "星图"平台推理一体机:优刻得自研推理框架,针对单节点显存带宽与算力优化,支持大模型量化(INT8/FP8/INT4)推理。在轨推理无需训练能力,因此可省去高带宽 HBM 训练优化的开销,转而优化单 batch 推理延迟。

  • 任务调度器:根据轨道光照/阴影状态、电池 SOC、热状态动态调度推理任务。这是与地面调度器的根本差异——地面调度以吞吐率为目标,热约束为被动边界条件;太空调度以"热-电-算耦合"为强约束。

与地面数据中心架构的根本差异

维度 地面数据中心 太空算力节点
调度目标 吞吐率/SLA 热-电-算耦合平衡
热约束 被动边界条件 主动调度变量
电力来源 电网(近乎无限) 光伏+储能(严格受限)
散热终态 大气/水体 深空辐射
算力规模 弹性扩展 单节点固定
维护方式 人工热插拔 全寿命无人维护

2.3 电源与能源管理层

职责:将太阳能转化为稳定直流电,并在光照/阴影期间维持母线电压稳定,同时配合散热层进行热管理。

关键技术解析

  • 高效光伏电池:推测采用三结 GaAs(砷化镓)电池而非地面常见单晶硅。三结 GaAs 实验室效率可达 30–35%(AM0 光谱,1367 W/m²),单晶硅仅 22–24%。更重要的是,GaAs 抗辐照性能优于 Si——在 1 MeV 电子辐照下,GaAs 衰减系数比 Si 低 30–50%。

  • 太阳能板背面液冷管道:这是该系统的核心创新之一。传统卫星太阳能板温度在光照期可升至 70–100°C,光电转换效率随温度升高而下降。背面液冷管道将服务器废热传导至板背面,同时降低板温,一举两得。

  • 高发射率辐射涂层:ε > 0.9 的黑色涂层,将废热以红外辐射形式排向深空。典型材料包括黑漆(如 Z306、Chemglaze Z306)、黑阳极氧化铝、碳纳米管涂层,发射率可达 0.92–0.96。

  • 储能电池组:典型采用锂离子电池(比能量 150–200 Wh/kg),阴影期供电,光照期充电。未来可能采用 Li-S(锂硫,理论比能量 2600 Wh/kg)或固态电池。

轨道周期对能源系统的严苛要求

低轨卫星轨道周期约 90–95 分钟,其中阴影期约 30–35 分钟(取决于轨道倾角与季节),即每 90 分钟一次完整的充放电循环。卫星设计寿命 3–5 年内电池循环次数约 17,000–30,000 次,远超地面储能应用(手机 ~1000 次,电动车 ~3000 次)。这要求:

  • DOD(放电深度)严格限制在 20–30%
  • 充电速率限制在 C/2 至 1C
  • 单体均衡管理避免"木桶效应"
  • 热管理避免电池温度超过 35°C(加速老化)

2.4 散热与流体循环层

职责:将服务器废热从 GPU 结点传输至辐射散热面,排向太空,同时为太阳能板降温。

关键技术解析

  • 机械泵驱单相液冷回路:使用高比热容冷却液(如 FC-72 氟化液、去离子水乙二醇混合液,比热容 3–4 kJ/kg·K),相比热管具有可调流量、可控温度的优势。泵的可靠性是关键——典型采用齿轮泵或离心泵,MTBF > 50,000 小时。

  • 闭环回路:服务器液冷板 → 太阳能板背面管道 → 辐射换热器 → 泵 → 服务器,全程密封。设计压力典型 0.2–0.6 MPa,需承受发射阶段振动与在轨热循环。

  • 传感器网络:温度(PT100 铂电阻/热电偶)、流量(科氏力质量流量计)、压力(压阻式传感器)实时监测,构成热控反馈闭环。采样率典型 1–10 Hz,通过 CAN/MIL-STD-1553 总线上传至 OBC。

  • 地面等效测试:真空罐内无法模拟辐射散热到深空,地面测试阶段配置辅助风扇,通过对流散热等效太空辐射散热(按 Stefan-Boltzmann 定律换算)。


3. 核心技术突破:全局热管理与全自主能源的闭环协同

3.1 传统方案的缺陷

传统星载电子设备散热采用独立设计:

  • 服务器散热:热管导热至专用辐射板
  • 太阳能板散热:被动辐射,温度自然平衡
  • 两者物理隔离,互不干涉

这种方案的三个根本缺陷

缺陷一:辐射板面积浪费
服务器需要专用辐射板,占用卫星宝贵的散热面积预算。卫星外壳面积有限,散热面与光照面、太阳能板面积之间存在零和博弈。

缺陷二:太阳能板过热导致光电效率损失
光照期太阳能板温度可达 80–100°C,对于不同电池技术:

  • GaAs:温度每升高 1°C 效率下降约 0.2–0.3%
  • 单晶 Si:温度每升高 1°C 效率下降约 0.4–0.5%
  • 多晶 Si:温度每升高 1°C 效率下降约 0.4–0.5%

在 100°C 下,GaAs 电池效率损失可达 15–25%,Si 电池更达 30% 以上。这意味着相同光照条件下,过热的太阳能板发电量显著下降,进一步加剧能源紧张——形成"过热→效率低→算力降级→任务失败"的恶性循环。

缺陷三:热源孤立
服务器废热(高品质热源,温度 60–90°C)未能被有效利用。在地面数据中心,废热回收已用于区域供暖;但在传统卫星设计中,这部分高品质热源白白通过专用辐射板散掉,未与太阳能板的冷却需求形成协同。

3.2 闭环流体回路设计:双效协同

冷却液完整路径

服务器 GPU 热点 (T ≈ 80–90°C, 热流密度 ~300 W/cm²)
       │
       ▼ 液冷板吸热(微通道换热,h ~ 10⁴ W/m²·K)
冷却液温度升高 (T_out ≈ 65°C)
       │
       ▼ 进入太阳能板背面管道
对太阳能板进行"反向冷却"
   - 太阳能板温度从 80°C 降至 40–50°C
   - 光电效率提升 8–12%
       │
       ▼ 冷却液进一步带走太阳能板自身吸收的太阳辐射热量
冷却液温度继续升高 (T ≈ 55°C)
       │
       ▼ 进入辐射换热器
向深空辐射散热 (T_sky ≈ 3 K, ε ≈ 0.93)
       │
       ▼ 冷却液温度降低 (T_in ≈ 30°C)
       │
       ▼ 循环泵回流至服务器

为何将太阳能板背面作为散热面——三重收益

收益一:光电效率提升
太阳能板温度从 80°C 降至 40°C,对于 GaAs 电池(温度系数 -0.25%/°C),效率提升:

Δη = 0.25% × (80 - 40) = 10%

直接增加发电量 10%,对于 1 kW 光伏阵列相当于多出 100 W 可用电力。

收益二:辐射面积复用
太阳能板面积通常远大于服务器辐射板所需面积(典型 1–3 m² vs 0.2–0.5 m²),无需额外增加辐射器,节省卫星质量与体积。

收益三:温度梯度优化
服务器废热(80–90°C)通过冷却液传输至温度较低的太阳能板(40–50°C),形成良好的传热温差,避免传统设计中"高温服务器→高温辐射板→低辐射效率"的困境。

辐射散热原理——Stefan-Boltzmann 定律

Q_rad = ε · σ · A · (T_surf⁴ - T_sky⁴)

其中:

  • ε:表面发射率(高发射率涂层可达 0.92–0.95)
  • σ:Stefan-Boltzmann 常数(5.67×10⁻⁸ W/m²·K⁴)
  • A:辐射面积(m²)
  • T_surf:辐射面温度(K)
  • T_sky:深空背景温度(约 3 K,可近似为 0)

定量计算:以 1 m² 辐射面、ε = 0.92、T_surf = 320 K(47°C)计算:

Q_rad = 0.92 × 5.67×10⁻⁸ × 1 × (320⁴ - 3⁴)
      ≈ 0.92 × 5.67×10⁻⁸ × 1.05×10¹⁰
      ≈ 547 W/m²

即 1 m² 辐射面在 47°C 下可散出约 547 W 热量。对于一台 1 kW 级 GPU 算力节点,考虑泵功耗与传输损耗,2 m² 辐射面积足够。这与典型卫星太阳能板面积(2–4 m²)完美匹配。

辐射能力随温度变化的敏感性:

  • T_surf = 300 K(27°C):Q_rad ≈ 417 W/m²
  • T_surf = 320 K(47°C):Q_rad ≈ 547 W/m²
  • T_surf = 340 K(67°C):Q_rad ≈ 722 W/m²
  • T_surf = 360 K(87°C):Q_rad ≈ 980 W/m²

可见温度每升高 20°C,辐射能力提升约 30%。但器件温度上限约束严苛,因此"在器件允许的高温下散热"是太空热控的核心思想。

高发射率辐射涂层的工作原理

  • 涂层在红外波段(特别是 8–25 μm 太空辐射主波段)具有高发射率
  • 真空环境下无氧化、无紫外分解,长期稳定(>5 年)
  • 典型材料选择:
    • Z306 黑漆:NASA 标准热控涂层,ε = 0.92–0.95,太阳吸收率 α ≈ 0.95(适用于背面,不需关注 α)
    • 黑阳极氧化铝:金属基材表面转化涂层,ε = 0.85–0.92,附着力强
    • 碳纳米管涂层:实验室 ε > 0.99,但工程化程度低
    • Ag/Quartz 镜面:低 α/ε 比,适用于需低温的辐射面

地面模拟测试的等效散热方法
真空中无法用风扇对流散热,但地面常压下若仅靠自然辐射,散热能力远低于在轨状态(因为地面环境温度 ~300 K,且无深空冷源)。因此地面测试采用辅助风扇强制对流:

Q_conv = h · A · (T_surf - T_air)

按 h = 15–30 W/m²·K(强制风冷)、T_air = 20°C、T_surf = 50°C 计算:

Q_conv = 20 × 1 × 30 ≈ 600 W/m²

与轨道辐射散热能力(547 W/m²)数量级相当,可作为等效测试方法。但需注意:地面风冷散热系数 h 随风速变化,需通过标定建立 h ↔ Q_rad 的等效映射关系,确保测试结果可外推至在轨状态。

3.3 能源管理策略

光照期/阴影期的电力调度逻辑

光照期(约 55–60 分钟):
  光伏发电 → 母线供电 + 储能电池充电 + 算力满载运行
  功率平衡:P_pv = P_load + P_charge + P_margin
  约束:P_pv 随光照角度变化,MPPT 跟踪最大功率点

阴影期(约 30–35 分钟):
  储能电池放电 → 母线供电 + 算力降级或维持
  功率平衡:P_batt_discharge = P_load
  约束:SOC_min ≤ SOC(t) ≤ SOC_max,避免深放电

储能电池组的充放电控制

  • CC-CV 充电:恒流(C/2 至 1C)充至截止电压,再恒压涓流,典型 4.2 V/cell(NMC 体系)
  • 放电深度限制:DOD 限制在 20–30%,避免深放电加速容量衰减。以 2000 Wh 电池组为例,可用电量仅 400–600 Wh
  • 均衡管理:电池组内单体电压均衡(被动均衡耗能,主动均衡高效但复杂),避免"木桶效应"导致整组容量下降
  • 温度管理:电池最佳工作温度 10–25°C,过高加速老化,过低内阻增大

轨道周期对算力调度的影响

低轨卫星轨道周期约 90–95 分钟,光照/阴影交替。这要求算力调度必须考虑:

  • 阴影期 GPU 功耗是否降级(如从 1000 W 降至 400 W)
  • 推理任务是否在阴影期暂停或排队
  • 电池 SOC 是否作为任务准入条件
  • 太阳能板温度(散热能力)是否限制算力上限

伪代码:基于轨道周期的算力调度策略

class OrbitalComputeScheduler:
    """
    基于轨道周期的太空算力调度器
    耦合约束:算力负载 ↔ 电池 SOC ↔ 服务器温度 ↔ 太阳能板温度
    """
    def __init__(self):
        # 轨道参数(典型 LEO 500km)
        self.orbital_period = 5400       # 90 min, seconds
        self.eclipse_duration = 2100     # 35 min
        self.sunlight_duration = 3300    # 55 min

        # 电池参数
        self.battery_capacity_wh = 2000
        self.soc_min = 0.20              # 20% 最低 SOC
        self.soc_max = 0.90              # 90% 最高 SOC(避免过充)

        # GPU 功耗档位
        self.gpu_power_full = 1000       # W, 满载
        self.gpu_power_throttle = 400    # W, 降级
        self.gpu_power_idle = 50         # W, 空闲

        # 热约束阈值(°C)
        self.server_temp_critical = 85
        self.panel_temp_critical = 70    # 超过则散热能力下降

    def get_orbit_phase(self, t):
        """返回当前轨道相位与剩余时间"""
        t_in_orbit = t % self.orbital_period
        if t_in_orbit < self.sunlight_duration:
            return 'sunlight', self.sunlight_duration - t_in_orbit
        else:
            return 'eclipse', self.orbital_period - t_in_orbit

    def estimate_energy_budget(self, phase, time_remaining, battery_soc):
        """估算当前相位可用电量"""
        if phase == 'sunlight':
            # 光照期:光伏供电 + 电池可补充
            pv_energy = 800 * (time_remaining / 3600)  # 800W 光伏
            batt_usable = (battery_soc - self.soc_min) * self.battery_capacity_wh
            return pv_energy + batt_usable
        else:
            # 阴影期:仅电池
            return (battery_soc - self.soc_min) * self.battery_capacity_wh

    def schedule_task(self, task, current_t, battery_soc, thermal_state):
        """
        task: {
            id, power_required, duration, priority,
            gpu_intensity, can_throttle
        }
        thermal_state: {
            server_temp, panel_temp, coolant_flow, coolant_temp_in
        }
        返回决策: execute_full / execute_throttled / defer / reject
        """
        phase, time_to_phase_change = self.get_orbit_phase(current_t)

        # 优先级 1: 热约束(硬约束)
        if thermal_state['server_temp'] > self.server_temp_critical:
            return 'defer_until_cooldown'

        if thermal_state['panel_temp'] > self.panel_temp_critical:
            # 太阳能板过热,散热能力受限,必须降级
            if task['can_throttle']:
                task['power_required'] = min(
                    task['power_required'],
                    self.gpu_power_throttle
                )
                return 'execute_throttled'
            else:
                return 'defer_until_cool'

        # 优先级 2: 能源约束
        energy_needed = task['power_required'] * task['duration'] / 3600  # Wh
        available_energy = self.estimate_energy_budget(
            phase, time_to_phase_change, battery_soc
        )

        if phase == 'eclipse':
            # 阴影期能源最紧张
            if energy_needed > available_energy * 0.8:
                # 保留 20% 余量
                if task['priority'] == 'high' and task['can_throttle']:
                    task['power_required'] = self.gpu_power_throttle
                    return 'execute_throttled'
                elif task['priority'] == 'low':
                    return 'defer_to_sunlight'  # 推迟到下个光照期
                else:
                    return 'reject'
            else:
                return 'execute_full'
        else:
            # 光照期:能源相对充足,但仍受热约束
            return 'execute_full'

    def update_thermal_setpoint(self, phase, battery_soc, task_load):
        """根据轨道相位动态调整热控目标"""
        if phase == 'eclipse':
            # 阴影期环境温度低,太阳能板无光照加热
            # 可加大冷却液流量,提升散热效率
            return {
                'flow_rate': 'high',          # 提升泵速
                'target_server_temp': 75,     # 允许稍高,利用辐射优势
                'panel_target_temp': -20,     # 阴影期板温低,散热能力强
            }
        else:
            # 光照期:太阳能板被加热,需平衡散热
            return {
                'flow_rate': 'medium',
                'target_server_temp': 80,
                'panel_target_temp': 40,      # 维持低温以保证光电效率
            }

    def predictive_schedule(self, task_queue, t_now, battery_soc, thermal_state):
        """
        预测式调度:基于未来 N 个轨道周期的能源/热状态
        安排任务队列
        """
        schedule = []
        t = t_now
        soc = battery_soc

        for task in sorted(task_queue, key=lambda x: -x['priority']):
            # 模拟未来 3 个轨道周期,寻找最优执行窗口
            for offset in range(0, 3 * self.orbital_period, 300):  # 5min 步长
                t_try = t + offset
                phase, _ = self.get_orbit_phase(t_try)
                # 简化:光照期优先安排高能耗任务
                if phase == 'sunlight' or task['power_required'] < self.gpu_power_throttle:
                    schedule.append((task['id'], t_try))
                    soc -= task['power_required'] * task['duration'] / 3600 / self.battery_capacity_wh
                    break
        return schedule

该调度器的核心思想是三层耦合决策:热状态作为硬约束(优先级最高),能源状态作为软约束(可降级),任务优先级作为优化目标。这与地面调度器"以吞吐率为目标"的设计哲学根本不同。


4. 极端环境工程挑战

4.1 热环境

轨道温度范围
低轨卫星外表面温度典型范围 -170°C 到 +120°C,取决于:

  • 光照/阴影状态
  • 表面涂层太阳吸收率/发射率比(α/ε)
  • 轨道姿态(是否面向太阳)

优刻得样机需保证内部服务器温度维持在 15–40°C 范围内(GPU 工作温度上限约 90°C,但长期工作建议 < 80°C),即需在外部 ±150°C 摆动下维持内部 ±25°C 稳定——这是典型 6–10 倍温度隔离需求。

真空环境下散热机制

散热机制 地面 真空 工程影响
自然对流 主导 失效 必须改用辐射/传导
强制对流(风冷) 有效 失效 风扇无效
热辐射 弱(被大气吸收) 主导 需高发射率涂层
热传导 辅助 内部主导 需高导热界面材料
相变(热管) 有效 有效 仍是关键手段

真空下:

  • 对流失效:真空无气体分子,自然对流与强制对流均失效
  • 辐射主导:所有外部散热必须依赖热辐射(Stefan-Boltzmann 定律)
  • 传导内部:芯片到液冷板、液冷板到外壳依赖传导,需高导热界面材料(如铟箔 k=87 W/m·K、导热硅脂 k=3–8 W/m·K、液态金属 k=70+ W/m·K)

热循环疲劳

  • 每 90 分钟一次温度循环(光照 +120°C ↔ 阴影 -170°C)
  • 设计寿命 3–5 年内累计 17,000–30,000 次循环
  • 主要风险:
    • 焊点疲劳:BGA 焊球因 CTE 不匹配产生剪切应力,最终开裂
    • 覆铜板分层:FR-4 与铜箔界面在循环应力下剥离
    • 连接器接触失效:接触件磨损导致接触电阻增大
  • 工程对策:
    • 选用低 CTE 基板(如 Kovar α=5.9×10⁻⁶/K、Invar α=1.2×10⁻⁶/K)
    • 柔性焊点设计(避免刚性约束)
    • 规避锡须生长(选用无铅锡银铜合金 SAC305,避免纯锡镀层)
    • 关键焊点底部填充(underfill)增强

4.2 辐射环境

单粒子效应(SEE):高能质子、重离子穿透器件,导致多种效应:

效应 缩写 机理 影响 严重程度
单粒子翻转 SEU 存储节点电荷翻转 数据错误 可恢复
单粒子瞬态 SET 组合逻辑瞬时毛刺 时序错误 可恢复
单粒子功能中断 SEFI 控制逻辑进入异常状态 器件锁死 需复位
单粒子闭锁 SEL CMOS 寄生晶闸管导通 过流烧毁 不可逆
单粒子烧毁 SEB 功率器件沟道烧毁 器件失效 不可逆

近地轨道(500 km 高度)单粒子翻转率典型值:

  • SRAM:1×10⁻⁷ – 1×10⁻⁵ upset/bit/day
  • DRAM:1×10⁻⁶ – 1×10⁻⁴ upset/bit/day
  • GPU 显存(GDDR/HBM):更高密度,需特别评估,典型 1×10⁻⁵ – 1×10⁻³ upset/bit/day

以 80 GB HBM 显存(6.4×10¹¹ bit)为例,每天翻转次数:

6.4×10¹¹ × 1×10⁻⁴ = 6.4×10⁷ flips/day

即每天可能发生数千万次位翻转!必须依赖 EDAC 纠错。

总剂量效应(TID):长期累积辐射导致:

  • MOSFET 阈值电压漂移(Vth shift)
  • 漏电流增加(功耗上升)
  • 跨导下降(速度变慢)

低轨 5 年累积剂量典型 1–10 krad(Si),太阳活动高峰期可达 20 krad。抗辐照器件需 ≥100 krad(Si) 能力,COTS 商用器件典型 10–30 krad 即退化。

防护策略

策略 实施方式 适用场景 代价
抗辐照芯片选型 Rad-Hard FPGA(如 Virtex-5QV) 关键控制逻辑 算力低、成本高
EDAC 纠错 汉明码、Reed-Solomon 码 存储器 面积开销 12–30%
三模冗余(TMR) 三份逻辑同时运算,多数表决 关键寄存器、状态机 资源 3 倍
物理屏蔽 铝制机壳 2–4 mm,局部钽贴片 整机剂量降低 质量 5–15 kg
软件检查点 周期性状态快照,异常时回滚 长时间推理任务 性能开销 5–10%
任务级冗余 关键推理结果多卡比对 高可靠推理 算力减半

GPU 的特殊挑战
商用 GPU(如 H100/B200)未经抗辐照加固:

  • TID 寿命约 10–30 krad,在轨 3–5 年存在退化风险
  • HBM 显存密度高,SEU 率显著
  • SEL 风险需电路级保护(电流监测+断电)

优刻得样机可能采用的应对策略:

  • 屏蔽:在 GPU 周围布置铝/钽屏蔽层
  • 定期重启:每日软复位刷新状态
  • 算力冗余:双卡热备份,结果比对
  • 任务级检查点:长任务分段执行,定期保存中间结果
  • 降频运行:降低时钟频率以减少 SEE 触发概率

4.3 微重力与力学环境

发射阶段力学环境

环境类型 参数 持续时间 工程影响
正弦振动 5–2000 Hz, 5–20g 数分钟 共振破坏
随机振动 0.04–0.1 g²/Hz, RMS 14.1g 数分钟 疲劳累积
冲击 1000–10000g 毫秒级 焊点断裂
声学噪声 140–150 dB 1–2 分钟 覆铜板分层

工程对策:

  • 加强结构设计(增加紧固件、规避悬臂结构)
  • 阻尼隔振(橡胶垫、金属阻尼器)
  • 避免共振点(模态分析,将一阶频率提升至 100 Hz 以上)
  • 液冷管路柔性连接(避免硬管在振动下断裂)

在轨微重力对液冷系统的影响

地面液冷系统依赖重力辅助气液分离(气泡自然上升至膨胀罐顶部)。微重力(10⁻⁶ – 10⁻³ g)环境下:

  • 气泡行为变化:气泡不上升,可能附着在管道壁或随流动迁移,形成"气塞"
  • 气液分离失效:传统膨胀罐失效,气液混合导致泵效率下降
  • 泵气蚀风险:气泡进入泵入口导致流量波动,严重时损坏泵

工程对策:

  • 单相液冷设计:维持冷却液全程单相(不沸腾),从源头避免气液两相。这要求冷却液工作温度严格低于沸点(FC-72 沸点 56°C,需保持温度 < 40°C)
  • 膜式除气器:使用疏水膜分离微量气体(PTFE 膜,孔径 0.1–1 μm)
  • 离心分离器:利用微弱离心力分离气液
  • 泵冗余:双泵并联,单泵失效可切换
  • 管路设计:避免局部低速区(气泡易聚集),保持流速 > 0.5 m/s

展开机构可靠性

  • 太阳能板展开机构(铰链、扭簧、火工品切割器)需在轨可靠展开
  • 单点失效可能导致整星断电
  • 历史上太阳能板展开失败案例:Galaxy 12(2005)、Nozomi(火星探测器)
  • 工程对策:
    • 冗余火工品(双切割器并联)
    • 地面展开试验(真空罐内多次演练)
    • 阻尼缓冲器(避免展开冲击)

4.4 真空环境

气体释放(Outgassing)

  • 塑料、胶水、涂层在真空下释放挥发物(VCM)
  • 挥发物凝结在冷的光学元件表面,造成污染(如望远镜镜面、星敏感器镜头)
  • 标准:ASTM E595,要求:
    • TML(Total Mass Loss)< 1.0%
    • CVCM(Collected Volatile Condensable Material)< 0.1%
  • 工程对策:
    • 所有材料需经真空烘焙预处理(典型 125°C 真空 24–48 小时)
    • 选用低释气材料(如 PTFE、PEEK、陶瓷)
    • 避免使用 PVC、普通环氧树脂

冷却液工作温度窗口
冷却液需在宽温度范围内保持液态且化学稳定:

冷却液 沸点 凝固点 工作窗口 比热容 适用性
FC-72 56°C -90°C -50 ~ 40°C 1.05 kJ/kg·K 单相低温
FC-40 165°C -57°C -50 ~ 150°C 1.05 kJ/kg·K 高温
水+乙二醇(50%) 105°C(加压) -40°C -30 ~ 90°C 3.35 kJ/kg·K 宽温
Galden HT55 55°C -110°C -100 ~ 40°C 0.97 kJ/kg·K 极低温
Novec 7000 34°C -120°C -100 ~ 25°C 1.18 kJ/kg·K 极低温

优刻得样机推测采用加压水乙二醇或专用氟化液。水乙二醇比热容高(泵功耗低),但凝固点限制低温边界;氟化液化学稳定但比热容低(需更大流量)。

密封与压力管理

  • 液冷回路必须全密封,泄漏会导致冷却液蒸发损失,最终失效
  • 接头选择:
    • 焊接接头(最可靠,但不可拆卸)
    • 金属密封圈(如 C 型金属密封圈,可拆卸但成本高)
    • 橡胶 O 圈(廉价但真空下老化加速)
  • 压力传感器监测泄漏(精度 ±0.1% FS)
  • 泄漏率要求:典型 < 1×10⁻⁶ sccs/s(标准立方厘米/秒)

5. 与现有太空计算方案的对比

维度 优刻得样机 星载边缘 AI 盒子 地面数据中心 深空探测专用计算机
定位 轨道算力节点 单星数据处理 地面集中计算 深空任务专用
算力规模 顶级 GPU(数百 TFLOPS) 低功耗 SoC(数十 GFLOPS–TOPS) 万卡集群(EFLOPS) 抗辐照定制 CPU(MFLOPS)
散热方式 闭环液冷+辐射散热 被动辐射板 蒸发冷却/风冷 热管+辐射板
能源 光伏+储能(自主) 太阳能板+电池 电网供电 RTG/太阳能
算力密度 ~1 kW/节点 ~10–50 W/节点 ~30–50 kW/机柜 ~5–20 W/节点
散热密度 ~300 W/cm²(液冷) ~5–20 W/cm² ~50–100 W/cm² ~1–5 W/cm²
维护性 无人维护 无人维护 可人工维护 极长寿命设计
寿命要求 3–5 年 3–5 年 5–10 年(可升级) 10–20 年
单位算力成本 高(抗辐照溢价) 低(COTS) 极低(规模效应) 极高(定制)
任务特点 多任务,可重配置 单任务固化 通用计算 单一任务,极度可靠
典型代表 优刻得+上理工样机 D-Orbit ION Google/AWS 数据中心 JPL RAD750

关键洞察

优刻得样机处于"星载 AI 盒子"与"地面数据中心"之间的工程空白区——它需要数据中心的算力密度,但又受制于太空的散热与能源约束。这正是"闭环协同设计"成为核心技术突破的根本原因。

从系统论角度看,该样机将三个原本独立的子系统(算力、能源、热控)的优化变量耦合到同一约束集中:

  • 算力决策影响热负载
  • 热负载影响太阳能板温度
  • 太阳能板温度影响光电效率
  • 光电效率影响可用电力
  • 可用电力限制算力决策

这种闭环耦合在地面数据中心中是弱耦合(电网近乎无限、散热能力强),在传统卫星中是解耦的(各子系统独立设计),而在优刻得样机中首次成为强耦合优化问题。


6. 从样机到工程化:落地路径分析

6.1 地面验证阶段(当前)

热真空试验(TVAC)

  • 真空度优于 1×10⁻⁵ Pa
  • 温度范围 -170°C 到 +120°C 可调
  • 典型流程:
    1. 常压功能测试(基线)
    2. 抽真空至 10⁻⁵ Pa
    3. 温度循环(-170°C ↔ +120°C,3–5 个循环)
    4. 极值驻留(每极点保持 4–8 小时)
    5. 真空下功能测试
  • 测试目标:
    • 验证液冷回路在真空下的密封性
    • 验证辐射散热的等效性
    • 验证热控涂层稳定性
  • 关键指标:稳态温度、温度梯度、热循环次数下的密封完整性

振动试验

  • 正弦振动:5–2000 Hz,典型 5–20g
  • 随机振动:模拟发射声学环境(典型 14.1 Grms)
  • 测试方向:三个正交轴分别测试
  • 测试目标:
    • 结构完整性(无裂纹、无松动)
    • 液冷接头无泄漏(振动前后压力对比)
    • PCB 无断裂、BGA 焊球无开裂

电磁兼容试验(EMC)

  • 辐射发射(RE):GPU 高频时钟(GHz 级)可能干扰卫星通信(S/X/Ka 波段)
  • 辐射敏感度(RS):卫星通信功率放大器对 GPU 的影响
  • 静电放电(ESD):真空下电荷积累无法通过空气泄放
  • 工程对策:屏蔽机箱、滤波器、光纤总线

太阳能板背散热等效测试

  • 在常压真空罐外配置风扇
  • 通过对比测试,建立"地面风冷散热能力 ↔ 轨道辐射散热能力"的换算关系
  • 验证冷却液流量、温度分布、太阳能板温度降低效果
  • 关键输出:散热效率曲线、太阳能板温度-效率提升曲线

6.2 在轨验证阶段(2026–2028)

搭载方式:低轨验证卫星(500–600 km 高度),可能搭载商业遥感卫星或专用技术验证星。

关键验证内容

项目 验证目标 测试方法 成功判据
算力模块在轨性能 GPU 推理吞吐率 vs 地面 基准测试(ResNet、BERT、遥感模型) 地面性能 ≥ 90%
液冷回路密封性 长期无泄漏 压力传感器监测 30 天泄漏 < 0.1%
散热系统效能 服务器结温、太阳能板温度 多点温度传感器 结温 < 85°C,板温 < 50°C
光电效率提升 太阳能板冷却后发电量 电流电压监测 提升 ≥ 8%
辐射效应 GPU 错误率、TID 退化 EDAC 统计、性能漂移 误码率 < 1×10⁻⁹
充放电循环 电池容量衰减 容量定期标定 1 年衰减 < 5%
任务调度 光照/阴影期调度策略 遥测下行 无任务丢失
抗辐照加固有效性 SEL/SEU 事件统计 电流监测、日志 无永久失效

在轨验证的关键不确定性

  • 商用 GPU 在真实辐射环境下的退化曲线(地面加速实验难以完全模拟)
  • 长期热循环对液冷接头密封性的影响
  • 微重力下冷却液两相行为的真实表现

6.3 组网商用阶段(2028–2030)

星地混合云架构

┌──────────────────────────────────────────────────┐
│                  地面智算中心                       │
│   大模型训练 · 历史数据存储 · 复杂仿真               │
│   模型压缩下发 · 算力调度全局编排                    │
└──────────────────────────────────────────────────┘
           ↑↓ 星地链路(Ka 波段,1–3 Gbps)
┌──────────────────────────────────────────────────┐
│                算力星座(千颗级)                    │
│  ┌──────┐    ┌──────┐    ┌──────┐                │
│  │节点1 │←──→│节点2 │←──→│节点3 │  星间激光链路    │
│  └──────┘    └──────┘    └──────┘                │
│   推理 · 预处理 · 实时分析 · 多星协同               │
└──────────────────────────────────────────────────┘
           ↑↓ 用户终端(S/Ka 波段)
┌──────────────────────────────────────────────────┐
│              地面用户/边缘应用                      │
│   灾害响应 · 农业 · 气象 · 国防                     │
└──────────────────────────────────────────────────┘

算力调度跨星地:基于任务延迟敏感性、数据量、能耗预算动态分配。

星间链路的数据分发:激光星间链路(ISL)速率可达 10–100 Gbps,使多星协同处理成为可能。例如:

  • 大幅宽遥感图像分块,多星并行处理
  • 时序图像的多星协同变化检测
  • 模型参数的星间同步

7. 星地混合云架构展望

7.1 协同模型

地面智算中心承担

  • 大模型训练(数千卡规模,月级周期)
  • 历史数据长期存储(PB 级)
  • 复杂多物理场全尺寸仿真(小时-天级)
  • 模型更新下发(压缩、量化后上注)

在轨算力星座承担

  • 实时遥感图像推理(目标检测、变化检测)
  • 数据预处理与压缩(下行前压缩 100–1000 倍)
  • 边缘智能(卫星自主决策,如云判、目标跟踪)
  • 时延敏感型任务(灾害响应秒级出结果)

7.2 优刻得"星图"平台在星地协同中的角色

"星图"平台作为推理一体机软件栈,承担四大职能:

┌─────────────────────────────────────────────────┐
│            星图平台软件栈                         │
├─────────────────────────────────────────────────┤
│ 1. 模型下发与管理                                 │
│    地面训练 → 量化压缩 → 上注至在轨节点            │
│    版本管理、回滚、A/B 测试                        │
├─────────────────────────────────────────────────┤
│ 2. 推理服务编排                                   │
│    根据任务类型路由至合适算力节点                   │
│    负载均衡、批处理、流水线                        │
├─────────────────────────────────────────────────┤
│ 3. 资源监控                                       │
│    实时采集各节点算力、热、电状态                   │
│    异常检测、告警、自动降级                        │
├─────────────────────────────────────────────────┤
│ 4. 故障转移                                       │
│    单节点失效时任务迁移至其他节点或回退地面          │
│    检查点恢复、状态同步                            │
└─────────────────────────────────────────────────┘

7.3 任务卸载策略

任务类型 数据量 延迟要求 算力需求 推荐位置 理由
灾害目标识别 100 MB–1 GB 秒级 在轨 延迟敏感
遥感图像超分 1–5 GB 分钟级 在轨 数据量大、带宽省
大气环流模拟 10–100 GB 小时级 地面 算力密集
大模型训练 TB 级 天级 极高 地面 算力密集+数据传输可行
星座轨道规划 1–10 GB 分钟级 地面 全局优化
星间协同避撞 <100 MB 秒级 在轨 延迟敏感
多时相变化检测 5–50 GB 分钟级 中高 在轨 避免下行多景图像
三维场景重建 10–100 GB 小时级 在轨(部分) 中间结果下行

7.4 调度策略

延迟敏感型任务

  • 优先在轨处理,避免星地往返时延(典型 100–200 ms 单向)
  • 阈值:任务要求延迟 < 500 ms 必须在轨
  • 例子:灾害响应、目标跟踪、避撞

算力密集型任务

  • 权衡"在轨算力成本" vs "星地下行带宽成本"
  • 下行带宽成本高时倾向在轨处理
  • 公式:若 T_compute_orbit + T_downlink_result < T_downlink_raw + T_compute_ground,则在轨处理
  • 例子:大幅宽遥感图像预处理

能耗约束任务

  • 阴影期算力降级,高能耗任务延后至光照期
  • 阈值:电池 SOC < 30% 时仅执行高优先级任务
  • 例子:大模型推理 vs 小模型推理的切换

热约束任务

  • 太阳能板温度过高时降级,避免散热能力下降
  • 阈值:板温 > 70°C 时 GPU 降频
  • 例子:高峰算力任务错峰至阴影期

8. 技术挑战与展望

8.1 抗辐照 GPU 的供应链问题

  • COTS GPU 无抗辐照版本:NVIDIA H100/B200 等 TID 寿命受限(10–30 krad),在轨 3–5 年存在退化风险
  • 抗辐照 FPGA 算力差距大:Xilinx Virtex-5QV 等抗辐照 FPGA 算力远低于商用 GPU(~100 GFLOPS vs ~1000 TFLOPS,差距 4 个数量级)
  • ITAR 法规限制:美国 ITAR(国际武器贸易条例)限制高端 GPU 出口,可能影响国际合作
  • 可能出路
    • 国产 GPU 加固版本(华为昇腾、寒武纪)——供应链自主可控
    • 专用 AI 加速器(如基于 RISC-V + 抗辐照工艺的定制 NPU)
    • 光子芯片(天然抗辐照,因光子不带电荷不受 SEU 影响)
    • 忆阻器/存算一体芯片(减少数据搬运,降低 SEU 影响)

8.2 在轨冷却液的长期稳定性

  • 3–5 年工作寿命要求冷却液化学稳定
  • 氟化液问题:长期高温可能分解产生 HF(氢氟酸),腐蚀金属管路
  • 水乙二醇问题:长期可能微生物污染(虽太空无微生物,但地面装配污染残留),乙二醇氧化产生酸性物质
  • 工程对策
    • 添加抗氧化剂、缓蚀剂
    • 定期化学监测(pH 值、电导率)
    • 过滤器(去除颗粒物)
    • 在线离子交换树脂(维持电导率)

8.3 太空碎片防护

  • 低轨碎片密度增加:1 cm 以上碎片碰撞可能造成灾难性破坏,Kessler 效应加剧
  • GPU 算力节点通常位于卫星内部,相对受保护
  • 太阳能板(散热面)面积大,碎片穿透可能造成冷却液泄漏
  • 工程对策
    • 太阳能板背面布置冗余管道(多回路设计,单回路泄漏不影响整体)
    • Whipple 屏(在散热面外布置薄铝板,撞击碎片气化)
    • 主动规避(基于 US Space Surveillance Network 数据机动)

8.4 国际太空法对轨道算力设施的规制

  • 《外层空间条约》(1967):国家对其空间物体负责,承担国际责任
  • 轨道频谱分配:由 ITU 管理,算力星座占用通信频谱(星地下行、星间链路)需协调
  • 光污染问题:太阳能板大尺寸可能影响天文观测(如 Starlink 引发的天文学界抗议)
  • 轨道拥堵:千颗级算力星座增加轨道拥挤,需遵守碎片减缓指南(25 年内离轨)
  • 算力星座退役后的离轨处置义务:需预留离轨燃料或采用导电绳等被动离轨装置

8.5 长期展望

技术演进方向

方向 时间窗口 关键突破 潜在影响
光子芯片在轨应用 2028–2030 光计算天然抗辐照 解决 SEE 问题
核电源(RTG/小型核反应堆) 2030–2035 持续电力,不依赖光照 支撑深空算力
在轨制造与组装 2030+ 降低发射约束 大型结构在轨建造
量子通信星地链路 2028–2032 绝对安全通信 星地链路安全
相变散热(PCM) 2027–2030 高潜热储能 平滑热负载波动
AI 自主健康管理 2026–2028 在轨故障自愈 降低运维成本

商业模式展望

  • 算力即服务(Space-Compute-as-a-Service):按推理次数/时长计费
  • 政企客户专属算力节点:定制化卫星搭载
  • 与遥感数据服务打包销售:数据+算力一体化
  • 星地混合云订阅:与地面云服务打通

结语

优刻得太空算力样机的核心创新不在于"将 GPU 送上天"——这是工程问题;而在于"将热-电-算三个独立子系统耦合为闭环"——这是系统架构创新。

其"将太阳能板背面作为辐射散热面"的设计,将传统卫星设计中互不干涉的两个子系统协同化:服务器废热不再是无用的副产品,而是降低太阳能板温度、提升光电效率的资源;太阳能板不再仅是能源采集器,同时成为算力散热的关键辐射面。这种"废热利用"思路与地面数据中心的废热回收供暖异曲同工,但工程约束从"经济性"变为"可行性"。

从样机到千颗级算力星座,仍有 3–5 年工程验证周期。但该系统所代表的"轨道数据中心"方向,与国星宇航+商汤的"商汤号"、Starlink 的星间处理共同构成 2026–2030 年太空计算的主流趋势。地面数据中心解决"算得多",太空算力解决"算得近"——两者将通过星地混合云架构,共同构成未来的全球算力基础设施。

太空算力的工程本质,是在严苛物理约束下求解一个多目标优化问题:最大化算力吞吐,受限于辐射散热能力、光伏发电能力、电池储能能力、抗辐照寿命。优刻得样机的贡献,在于首次给出了一个工程可行的耦合解——这个解不是任何单一技术的突破,而是系统级架构的创新。


参考资料(公开信息)

  • 优刻得 WAIC 2026 发布材料
  • 国星宇航+商汤科技算力卫星规划公开报道
  • NASA State-of-the-Art Small Spacecraft Technology (2023)
  • ESA Thermal Control Handbook
  • Stefan-Boltzmann 辐射散热基础物理
  • ITU-R S 系列频谱分配建议
  • ASTM E595 真空释气测试标准
  • 《航天器热控设计手册》
  • 《卫星工程概论》