Arista 7130 FPGA交换机解析与其在高频交易中的应用

目录

1.Arista 7130 FPGA交换机结构

1.1 前端光口I/O层

1.2 L1 Crosspoint交叉矩阵交换层

1.3 可编程FPGA计算层

1.4 控制平面x86主机管理层

2.底层转发与FPGA处理原理

2.1 L1 Crosspoint底层转发原理(纳秒级无缓存转发)

2.2 FPGA数据包处理流水线原理

2.3 确定性时延核心优化原理

3.HFT核心逻辑Verilog示例

4.关键业务性能对标数据


Arista 7130系列源自2018年收购Metamako产品线,是全球唯一L1交叉矩阵+板载Xilinx UltraScale+ FPGA+EOS统一操作系统一体化超低时延可编程交换平台,专为高频交易(HFT)、交易所行情分发、纳秒级数据包处理设计。设备分为纯L1无FPGA的Connect系列、搭载1–3片 Virtex UltraScale+FPGA 的7130E/L/LBR可编程系列,端口直通时延最低4ns,FPGA内部数据包处理时延可低至39ns,时间戳精度<400ps。

1.Arista 7130 FPGA交换机结构

Arista 7130 FPGA整机分层硬件架构图如下图所示:

1.1 前端光口I/O层

7130L系列提供32/48/96路SFP+,支持1G/10G/25G光模块;7130B高密度机型32路QSFP-DD可拆分256路子端口。物理层集成信号重定时、眼图监控、光功率实时采集,端口到内部交叉芯片走线时延严格控制在3ns内,无SERDES缓存排队。 关键硬件指标:抖动<100ps,支持任意协议比特透传(以太网、FAST行情、FIX订单协议)。

1.2 L1 Crosspoint交叉矩阵交换层

核心无源全连接交叉芯片,实现纯物理层比特级直通转发,无数据包解析、无MAC地址查表、无存储转发。端口间点对点时延:

1.3 可编程FPGA计算层

7130L/LBR机型搭载1片中央FPGA+2片Leaf边缘FPGA,均为Xilinx Virtex UltraScale+VU13P,单芯片逻辑资源:4.4M逻辑单元、1440个DSP、3.7GB片上BRAM/URAM,无需外接DDR避免访存时延。

Leaf FPGA:直连前端光口,完成数据包切片、FAST行情解码、精准时间戳、流量过滤;每片 Leaf 绑定14路以太网端口。

Central FPGA:全局汇聚,实现MetaMux多路行情聚合、FIX订单路由、交易信号触发转发;三片 FPGA通过MMP并行高速总线互联,片间传输时延仅8ns。

FPGA访问通道:光口→FPGA直连链路无中间芯片,入口时延固定3ns,数据流不经过CPU内存。

1.4 控制平面x86主机管理层

板载低功耗x86_64处理器,运行Arista EOS定制系统,仅负责配置下发、监控采集、FPGA镜像加载,不参与业务数据流,彻底规避通用交换机CPU抢占数据包带来的抖动。支持JSON-RPC、标准CLI、Telemetry遥测,兼容自动化运维。

2.底层转发与FPGA处理原理

2.1 L1 Crosspoint底层转发原理(纳秒级无缓存转发)

传统L2/L3交换机采用存储转发架构:

数据包完整存入缓存→解析头部→查表→调度输出

最小时延数百纳秒,并发流量下排队时延波动可达微秒级,无法满足HFT纳秒确定性要求。

7130 L1交叉矩阵采用Cut-Through比特级流水线,核心原理:

光口SERDES串行比特流进入交叉芯片后,无需等待完整数据包接收,前导码识别完成后立即建立物理通路;

内部为全交叉无源金属走线,无逻辑门缓存,比特信号直接路由至输出端口;

多播复制为硬件并行拷贝,任意1:N镜像复制时延与单播完全相等,不存在复制扇出带来的延迟增量;

仅做信号整形重定时,不解析以太网MAC、IP、应用层协议,实现协议无关透传。

2.2 FPGA数据包处理流水线原理

FPGA内部采用无共享资源多级流水线状态机,单周期完成一级运算,流水线无气泡、无分支等待,是HFT 行情/订单加速核心,流水线四级拆解:

阶段1:SERDES接收与精确时间戳(MetaWatch)

光口比特流进入Leaf FPGA GTX收发器,硬件锁相环同步全局PTP/White Rabbit时钟,数据包前导码第1bit到达时立即写入64位皮秒级时间戳寄存器,精度<400ps,用于交易所合规时延审计、行情时序对齐。

阶段2:数据包切片与协议硬件解码

内置Arista官方低时延IP核:10G/25GMAC、FAST行情解码器、FIX订单协议解析器,全部硬件逻辑实现,无CPU介入。以FAST行情为例:硬件状态机并行提取合约代码、买卖盘五档价格、最新成交价,单数据包解码周期<12ns。

阶段3:用户自定义业务逻辑

开发者通过Verilog/VHDL或Vitis HLS开发HFT策略逻辑,部署于Central FPGA片 BRAM,典型运算:

行情价差套利判断;

价格阈值触发订单生成

多交易所行情流聚合过滤(MetaMux,多路行情合并时延39ns);

非法订单、无效行情流硬件丢弃,减少下游交易服务器负载。

阶段4:数据包重构与SERDES发送

处理完成的数据包并行送入输出SERDES,无需缓存排队,直接驱动光口发送,输出固定时延 5ns。

2.3 确定性时延核心优化原理

数据流与控制平面物理隔离:业务流仅走FPGA/Crosspoint,CPU仅做配置,无操作系统中断抢占;

全片上存储设计:行情簿、订单规则全部存入FPGA BRAM/URAM,不访问外部DDR内存,消除数十纳秒访存抖动;

固定流水线级数:FPGA处理链路流水线深度固化,无论数据包长短,总时延波动<50ps;

无调度队列:放弃传统交换机共享缓存调度,采用点对点专用数据流通道,无排队时延。

3.HFT核心逻辑Verilog示例

该模块部署于7130 Central FPGA,实时解析FAST行情,当价差突破阈值时硬件生成FIX下单数据包,全程单流水线无阻塞:

// 7130 Central FPGA 行情套利触发模块
module hft_trigger(
    input wire          clk_312mhz,       // FPGA高速业务时钟
    input wire          pkt_valid,        // 有效行情数据包标志
    input wire [63:0]   symbol_id,        // 合约代码
    input wire [63:0]   bid_price,        // 买一价
    input wire [63:0]   ask_price,        // 卖一价
    input wire [63:0]   spread_thresh,    // 预设价差阈值(EOS配置下发)
    output reg          order_tx_en,      // 订单发送使能
    output reg [511:0]  fix_order_pkt     // 硬件生成FIX下单报文
);

reg [63:0] spread_calc;
// 流水线1:单周期计算买卖价差
always @(posedge clk_312mhz) begin
    if(pkt_valid) begin
        spread_calc <= ask_price - bid_price;
    end else begin
        spread_calc <= 0;
    end
end

// 流水线2:价差阈值判断,硬件生成订单
always @(posedge clk_312mhz) begin
    if(pkt_valid && spread_calc > spread_thresh) begin
        order_tx_en <= 1'b1;
        // 预存BRAM的标准FIX订单模板填充价格字段
        fix_order_pkt <= {symbol_id,bid_price,64'd100,32'd1};
    end else begin
        order_tx_en <= 1'b0;
        fix_order_pkt <= 512'd0;
    end
end
endmodule

EOS系统配置命令,交换机控制平面CLI配置,用于HFT业务部署:

# 1. 加载自定义FPGA比特流镜像
fpga application load hft_arbitrage.bit slot central
# 2. 开启全局皮秒级时间戳
meta-watch enable precision 400ps
# 3. L1物理层端口直通(交易所行情入口→交易服务器镜像)
l1 cross connect port 1-48 any
# 4. 开启MetaMux多路行情聚合(16路交易所行情汇聚至FPGA)
meta-mux group 1 ports 1-16 aggregate-fpga central
# 5. 遥测采集FPGA处理时延统计
telemetry streaming add fpga-latency counters

4.关键业务性能对标数据

指标 传统分光器 + 商用交换机 + PCIE FPGA 卡 Arista 7130L 一体化 FPGA 交换机 性能提升
行情复制单播时延 220ns 5ns 97.7% 时延缩减
套利策略端到端总时延 680ns 72ns 89.4% 时延缩减
时延抖动范围 ±800ns ±50ps 抖动降低 99.9%
多播扇出上限 8 路(分光器损耗限制) 96 路(无信号损耗) 12 倍端口扩展
单设备部署设备数量 3 台(分光 + 交换机 + 加速卡) 1 台 机房占地减少 2/3
posted @ 2026-07-07 20:56  hlayumi  阅读(17)  评论(0)    收藏  举报