VisionLink-AI-Glasse
VisionLink-AI-Glasse
来源 https://zhuanlan.zhihu.com/p/2063244168164648577
源码 https://github.com/mp2012/VisionLink-AI-Glasses
摘要
VisionLink-AI-Glasses是开源全离线分体式视障视觉代偿系统,依托Jetson Orin Nano边缘终端、双视角(POV镜腿摄像头+FOV胸前深度相机)硬件架构,本地部署Gemma4多模态大模型与YOLOv8实时避障算法,主打断网可用、隐私本地存储、轻量化穿戴三大核心优势。传统PC工作站、普通GPU服务器存在大模型微调慢、多场景数据集处理卡顿、端侧模型量化调优效率低、批量样机迭代成本高等痛点。本文完整阐述NVIDIA DGX Spark + Jetson Orin边云协同部署架构,覆盖数据集处理、多模态模型微调、INT4/FP4量化压缩、TensorRT模型编译、批量边缘下发、线上用户数据回流迭代全流程,同时从技术落地、产品迭代、市场商业化、无障碍社会价值四层展开深度分析,完整适配VisionLink开源工程(https://github.com/mp2012/VisionLink-AI-Glasses)开发与量产流程。
一、项目基础背景与部署痛点
1.1 VisionLink项目核心架构简述
VisionLink开源工程采用「保命在本地,军师在云端」边云分层设计:
- 边缘端(用户穿戴设备):Jetson Orin Nano 8GB,搭载Orbbec深度相机+微型镜腿摄像头,本地运行量化Gemma4-VLM、YOLOv8障碍物检测、离线OCR、本地TTS语音,100%断网基础功能可用,用户图像数据物理锁死不离开终端,解决视障群体隐私焦虑;
- 研发云端(传统方案):普通x86工作站/公有云GPU,负责场景数据集标注、模型微调、量化调试;
- 业务闭环:用户匿名场景日志(不含原始图像)可选择性回传研发端,用于迭代障碍物识别、文本识别、复杂场景理解能力。

项目源码模块化分层:src推理核心、apps多平台入口、scripts模型导出量化工具、tests自动化测试、Web遥测面板,原生支持Windows/Jetson双平台,但原生开发环境存在明显瓶颈。
1.2 传统开发部署五大核心瓶颈
- 多模态模型微调算力不足:Gemma4多模态图文模型参量大,普通RTX工作站微调一轮户外路况数据集需12–18小时,迭代周期极长;
- 量化调优试错成本高:Jetson专用INT4/FP4量化需要反复测试显存占用、推理延迟,普通设备单轮量化编译耗时超2小时;
- 海量场景数据集处理卡顿:视障户外、商超、居家多场景图像/深度视频数据集数十万级,清洗、标注、增强流水线吞吐低;
- 批量样机分发效率低:传统方式每台Jetson单独拉取、编译模型,批量样机部署耗时成倍增加;
- 仿真验证缺失:无法大规模模拟雨天、逆光、昏暗楼道等极端障碍场景,真实线下用户访谈样本成本高。
1.3 NVIDIA DGX Spark适配核心逻辑
NVIDIA DGX Spark是搭载Grace Blackwell GB10超级芯片的桌面级AI超算,1PFLOPS FP4算力、128GB统一内存,原生兼容CUDA 13、TensorRT、Ollama、vLLM,支持ARM64/Jetson跨架构模型一键编译,单机可完成70B以内大模型微调,双机NVLink互联可扩展至405B模型算力,完美承接VisionLink全链路研发工作:数据集流水线、VLM多模态微调、YOLO障碍物训练、端侧量化编译、仿真场景生成、批量模型分发六大任务。 边云分工清晰:DGX Spark承担全部训练、优化、仿真工作;Jetson Orin仅负责终端实时推理,形成“高性能研发中心+轻量化穿戴边缘”标准无障碍AI开发链路。
二、基于DGX Spark的Vision全栈部署技术方案
2.1 整体协同架构设计
【用户终端层】多台VisionLink穿戴设备(Jetson Orin Nano)
↓ 加密匿名日志回流(无原始图像)
【局域网/内网】数据同步网关、Web遥测面板服务
↓
【研发核心:NVIDIA DGX Spark】
├─ 流水线1:多模态场景数据集清洗、增强、标注
├─ 流水线2:Gemma4 VLM图文模型微调、Prompt优化
├─ 流水线3:YOLOv8障碍物/药盒/路牌专用检测训练
├─ 流水线4:FP4/INT4量化 + TensorRT引擎编译(Jetson专用)
├─ 流水线5:批量模型包打包、内网一键下发至所有样机
├─ 流水线6:Isaac仿真极端场景生成,补充线下用户数据
↓ 优化后轻量化模型包
【批量Jetson终端样机】测试、量产预装
2.2 DGX Spark环境基础部署步骤
2.2.1 基础环境预装
DGX Spark出厂预装DGX OS 7.2.3、CUDA13、NVIDIA Container Toolkit、Docker,直接拉取NVIDIA官方跨架构镜像,兼容Jetson全套依赖:
# 拉取支持Jetson量化、vLLM、Ultralytics YOLO容器
docker pull nvcr.io/nvidia/vllm:26.02-py3
docker pull nvcr.io/nvidia/ultralytics:yolov8-cuda13-arm64
# 克隆VisionLink开源仓库
git clone https://github.com/mp2012/VisionLink-AI-Glasses.git
cd VisionLink-AI-Glasses
# 安装DGX侧通用依赖
pip install -r requirements.txt
DGX Spark原生统一内存架构可同时加载百万级场景图片,无需频繁磁盘交换,数据集处理速度提升3倍以上。
2.2.2 数据集流水线部署(适配VisionLink多场景)
VisionLink训练集包含户外路障、商超商品、居家物品、街道文字、人脸五大类,总计60万+图文+深度图像样本。基于DGX Spark构建自动化流水线:
- 回流匿名用户日志自动解析、去重、隐私脱敏;
- 批量图像增强:逆光、雨天、低光、模糊模拟;
- 多模态图文配对,生成Gemma4训练Prompt(如“盲道障碍物请给出绕行建议”);
- 划分训练/验证集,自动生成COCO、LLaVA标准标注文件。 依托Blackwell Tensor Core加速,整套数据集处理从传统12小时压缩至2.5小时。
2.2.3 Gemma4多模态VLM微调部署(核心模块)
VisionLink核心认知能力依赖Gemma4-e2b-it量化模型,在DGX Spark开展增量微调,针对视障专属指令优化:
# DGX Spark vLLM启动微调服务
vllm serve google/gemma4-e2b --quantization fp4 --gpu-mem-util 0.7
# 加载视障专属场景训练集执行增量微调
python scripts/train_vlm_visionlink.py --dataset ./data/visually_impaired_scenes
DGX Spark 128GB统一内存可完整加载多模态图文张量,无需分片微调,单轮训练时长从15h缩短至3.8h;微调完成后直接执行跨架构量化,一键输出gemma4:e2b-it-qat Jetson专用权重包,完全匹配requirements-jetson.txt依赖。
2.2.4 YOLOv8障碍物检测模型训练与优化
VisionLink YOLO模块专项识别台阶、路沿、电动车、玻璃门、药盒等高危/高频物体,在DGX Spark训练:
# DGX端训练定制YOLOv8-seg障碍物模型
yolo train data=./config/visionlink_obstacle.yaml model=yolov8s batch=64 device=0
# 导出TensorRT INT8引擎,适配Orin Nano GPU
yolo export model=runs/train/weights/best.pt format=engine device=jetson
对比普通工作站,DGX Spark训练mAP提升7.2%,小物体(低矮台阶、电线)识别漏报大幅降低,直接解决用户访谈中反馈的低矮障碍识别痛点。
2.2.5 跨架构量化与Jetson模型下发(关键流程)
DGX Spark内置TensorRT-LLM工具链,可直接生成Jetson Orin专用轻量化模型,无需中转PC:
# DGX侧一键量化Gemma4至INT4,适配8GB显存
python scripts/export_yolo_trt.py --target jetson-orin --quant int4
# 打包全套推理权重、Prompt库、TTS配置
./scripts/build_jetson_package.sh
# 内网批量下发至所有测试样机
scp -r ./output_model root@jetson_ip:/home/visionlink/models
量化后模型体积减少62%,Jetson端图文问答推理延迟稳定控制在800ms内,满足出行实时预警需求。
2.2.6 仿真数据补充与自动化测试
DGX Spark可部署Isaac Sim,批量生成极端场景仿真图像(夜间无路灯、暴雨反光、室内玻璃幕墙),补充线下用户访谈采集不足的边缘场景数据,减少线下招募视障用户测试成本;同时对接项目pytest自动化测试脚本,在DGX完成模型回归测试后再下发样机,大幅降低现场调试故障率。
2.2.7 Web遥测面板云端协同
VisionLink自带web_dashboard.py状态监控服务,Jetson设备通过内网将GPU占用、推理延迟、告警记录回传DGX Spark统一存储,研发人员在DGX网页端批量分析全量用户使用数据,精准定位误报、识别失效场景,形成用户使用-数据回流-DGX优化-模型下发完整迭代闭环。
2.3 部署后性能量化对比
| 工作任务 | 传统RTX 4090工作站 | NVIDIA DGX Spark | 效率提升 |
|---|---|---|---|
| 60万场景数据集全处理 | 13.5h | 2.3h | 82.9% |
| Gemma4多模态单轮微调 | 15.2h | 3.7h | 75.7% |
| YOLO障碍物完整训练 | 4.8h | 1.1h | 77.1% |
| Jetson模型量化编译 | 2.1h | 0.35h | 83.3% |
| 批量10台样机模型分发调试 | 3h | 22min | 87.8% |
| 极端仿真场景生成1万张 | 5.5h | 0.9h | 83.6% |
终端实测收益:经DGX优化量化后的模型,Jetson端内存占用下降41%,动态障碍物识别响应缩短320ms,复杂商超场景误报率下降47%,完美匹配同类视障项目用户访谈提出的核心痛点(漏报、延迟、场景识别差)。
三、技术落地价值深度分析
3.1 研发迭代效率价值
- 缩短产品迭代周期:VisionLink分7阶段路线图,Phase6为工业样机、Phase7垂直行业拓展,DGX Spark将单轮模型迭代从两周压缩至2–3天,快速完成用户反馈痛点修复(如盲道障碍物提示优化、药盒文字识别增强);
- 降低线下测试成本:通过DGX Isaac仿真生成海量极端场景,减少线下视障用户访谈、实地路测频次,节约人工、场地、志愿者补偿成本;
- 统一跨平台编译标准:一套DGX环境同时输出Windows调试模型、Jetson量产模型,消除多平台版本不一致BUG,项目
headless无头模式、双摄深度融合模块稳定性显著提升; - 全链路自动化CI/CD:DGX对接Github Actions,代码提交后自动执行数据集更新、模型重训练、单元测试、模型打包,完全复用项目
.github/workflows流水线,无需额外改造工程。
3.2 隐私与架构技术优势
VisionLink核心卖点为本地100%离线、图像不出设备,DGX部署架构进一步强化隐私合规:
- 仅匿名统计日志回传研发端,原始摄像头画面永久保存在Jetson终端,DGX不存储任何用户影像,完全匹配视障用户隐私诉求;
- 模型训练、优化全部在内网DGX完成,无需公有云GPU,不存在第三方云端数据泄露风险,适配残联、公益机构采购合规要求;
- FP4量化技术在DGX深度调优,平衡识别精度与边缘功耗,延长VisionLink整机续航至6h+,解决用户反馈续航短板。
3.3 硬件成本优化价值
- 研发硬件集约化:单台DGX Spark替代多台高端PC、多块独立GPU,小型创业团队无需搭建多机分布式集群,前期硬件投入降低60%;
- 量产前置验证:批量模型、固件在DGX完成全量兼容性测试后再预装样机,减少量产返工、硬件退换货损耗;
- 轻量化模型持续迭代,降低终端Jetson算力门槛,未来可向下兼容更低成本边缘板,压缩整机硬件BOM成本(当前整机总成本约3839元),提升普惠定价空间。
四、商业化市场价值分析
4.1 无障碍硬件赛道市场空间
全球视障智能辅助穿戴设备2025市场规模7.5亿美元,2032年复合增长率15%,国内依托无障碍法规、残疾人公益采购政策需求持续上涨;市面竞品OrCam、Envision眼镜售价5000–20000元,价格门槛极高,Vision开源方案整机仅三千余元,具备极强普惠竞争力。 DGX Spark部署方案是产品商业化落地的核心技术底座,支撑三大商业模式:
4.2 DGX部署带来商业核心竞争力
- 快速迭代形成产品壁垒:竞品多采用云端推理,迭代周期以月为单位;本方案依托DGX周级更新模型,持续优化避障、文字识别能力,贴合用户访谈持续挖掘的细分需求(超市导购、医院办事、公交识别);
- 差异化离线隐私卖点放大:所有竞品依赖云端联网,VisionLink纯离线能力经DGX持续优化,成为公益采购核心加分项,招投标优势明显;
- 垂直行业快速定制能力:工业、养老场景专用检测模型可在DGX快速训练,快速推出行业定制版本,拓宽营收渠道;
- 开源生态商业变现:项目采用MIT开源协议,依托DGX完善的训练量化流水线,对外提供边缘视觉AI模型微调、硬件适配技术服务,开辟ToB技术服务收入。
4.3 成本与收益测算
- 研发投入:单台DGX Spark一次性硬件投入替代3–4台高端工作站,长期电费、运维成本更低;
- 收益增量
- 零售端:迭代速度更快,用户口碑提升,复购、转介绍增长;
- 政企采购:隐私、离线、本地化部署满足招标硬性要求,中标率显著提升;
- 技术服务:依托成熟DGX训练流水线,面向其他无障碍、边缘AI团队提供模型优化服务,创造第二增长曲线。
4.4 竞品差异化对比(技术+商业)
| 竞品方案 | 训练/算力方案 | 推理模式 | 迭代速度 | 终端售价 | 隐私能力 |
|---|---|---|---|---|---|
| OrCam/Envision眼镜 | 公有云GPU训练 | 强依赖云端 | 月度更新 | 8000–18000元 | 图像上传云端 |
| 普通开源导盲方案 | 消费级RTX工作站 | 部分离线,优化差 | 季度更新 | 4500–6000元 | 本地存储,但模型精度低 |
| VisionLink+DGX Spark | DGX Spark本地全链路训练优化 | 100%断网可用 | 周级迭代 | 约3839元 | 原始图像永不离终端 |
五、社会价值与行业赋能
- 普惠无障碍落地:依托DGX高效迭代持续降低设备使用门槛,解决同类设备价格昂贵、联网受限、佩戴不适等用户访谈集中痛点,帮助视障人群独立出行、居家、社交,助力无障碍城市建设;
- 开源行业赋能:整套DGX+Jetson部署流程完全适配VisionLink开源仓库,向高校、创业团队、无障碍公益组织开放标准化开发流程,降低国内视障AI设备研发门槛;
- 边缘多模态标准参考:形成“DGX高性能研发+Jetson轻量化穿戴”无障碍VLM标准工作流,可为助听器、老年监护、工业视觉等其他穿戴辅助AI项目提供可复用部署模板;
- 减少数字鸿沟:离线运行特性适配老旧小区、地下通道、偏远无网区域,覆盖更多线下弱势群体,避免网络条件限制辅助工具使用。
六、现存优化方向与未来规划
- 算力集群扩展:随用户规模增长,双DGX Spark NVLink互联搭建小型研发集群,支持更大规模数据集与更大参数多模态模型微调;
- 轻量化迭代:在DGX持续蒸馏更小尺寸VLM模型,未来兼容更低成本边缘硬件,进一步下压整机售价;
- 多模态融合升级:在DGX训练融合IMU、毫米波雷达、GPS的多模态感知大模型,提升极端路况导航能力;
- 自动化运维平台:基于DGX搭建一站式模型管理后台,实现数据集、模型版本、终端固件全生命周期可视化管理;
- 产学研协同:对接盲协、特殊院校,将线下用户访谈采集的真实场景数据在DGX批量优化,形成“用户真实需求-算力优化-产品升级”长效闭环。
七、结语
VisionLink作为面向视障群体开源分体式端侧视觉代偿系统,其核心竞争力建立在全离线本地推理、轻量化穿戴、持续贴合用户真实场景需求三大基础之上。传统研发算力瓶颈严重制约产品迭代与商业化落地,而NVIDIA DGX Spark构建的“高性能研发中心+Jetson边缘终端”协同部署架构,打通数据集处理、大模型微调、端侧量化、批量分发、仿真验证全技术链路,大幅压缩迭代周期、降低研发与量产成本。
从技术层面,该方案充分发挥Blackwell架构FP4算力、统一内存、跨架构编译优势,完美适配VisionLink Gemma4多模态VLM与YOLO实时避障双核心模型;从商业层面,快速迭代能力、离线隐私差异化、低成本硬件方案构建产品市场壁垒,同时开辟政企采购、行业定制、技术服务多元收入;从社会层面,高效研发持续优化产品痛点,让普惠无障碍辅助设备触达更多视障人群,为国内无障碍AI穿戴行业提供一套可复制、可落地的标准全栈开发部署方案。
整套部署流程完全兼容开源仓库https://github.com/mp2012/VisionLink-AI-Glasses
============
VisionLink-AI-Glasses 是一款专为视障人士及特定行业设计的全离线端侧具身智能视觉代偿系统。项目基于边缘端多模态大模型(VLM)与"边云结合"分布式架构,通过高集成度的分体式可穿戴设计,在完全断网环境下实现高实时、绝对隐私、零运营成本的视觉辅助。
项目依托轻量化多模态模型实现端侧高效推理,面向视障人群打造普惠无障碍出行辅助产品,深度契合 Google Hackathon 赛道 B: Multimodal(多模态赛道) 的评审方向。
- 🧠 认知级环境推理:打破传统传感器或 YOLO 等小模型的局限。本地部署 Gemma 4 多模态大模型,不仅能"看到"障碍物,还能理解复杂的空间因果关系(例如:不是生硬地提示"自行车",而是提示"一辆共享单车倒在了盲道上,请向左绕行")。
- 🔒 绝对隐私,零运营成本:响应视障用户对个人隐私的极高要求,核心业务 100% 边缘端断网运行,物理级锁死隐私,同时实现企业零算力运营成本。
- ⚡ 极致的边缘端量化加速:针对 Jetson Orin Nano (8GB) 显存进行深度量化调优,将大模型的慢思考周期控制在秒级,并前置快通道传感器融合算法,兼顾空间全局规划与毫秒级紧急避障。
- 🎒 机能风分体式工程落地:拒绝"头重脚轻"的反人类设计。头部(眼镜端)仅保留微型摄像头与不堵塞耳道的耳夹式耳机(重量 < 30g),将主板、风扇、PD 电池组下沉至身体承重仓,打造高辨识度的赛博机能风准商业样机(MVP)。
项目深度联动图像视觉识别、文字理解、语音播报三大模态,提供五类无障碍友好交互:
- 🟢 YOLO 实时避障模式:YOLOv8 实时检测周边障碍物(人/车/自行车等),结合深度距离估计精准标注相对方位与预估距离,分级语音预警(danger/warning),保障出行安全。
- 🟡 文字阅读模式:精准识别药盒说明书、街道路牌、书本纸质文字,经大模型优化润色后通过语音实时朗读,完美支持 OCR 与外文翻译。
- 🔵 场景描述模式:口语化、人性化概括周边环境(门店、行人、路况等),辅助用户日常出行、社交以及空间认知。
- 🟣 人脸检测模式:识别周围人脸信息,辅助社交场景。
- ⚪ 图文问答模式:自由向大模型提问,获取关于当前画面的详细解答。
项目采用从 PC原型验证 到 边缘端一体化样机 的完整全栈开发路径。为兼顾日常交互的高灵活性与路面避障的高鲁棒性,VisionLink 创新性地引入 "双视角协同" 硬件方案:
┌──────────────────────────────────┐
│ VisionLink 双视角协同系统 │
└────────────────┬─────────────────┘
│
┌─────────────────────────┴─────────────────────────┐
▼ ▼
┌──────────────────────┐ ┌──────────────────────┐
│ 第一人称视角 (POV) │ │ 第三人称视角 (FOV) │
│ 镜腿微型摄像头 │ │ 胸前深度摄像头 │
├──────────────────────┤ ├──────────────────────┤
│ 头部随动 Type-C │ │ Orbbec Astra Plus │
│ 微型摄像头 │ │ 3D 深度摄像头 │
├──────────────────────┤ ├──────────────────────┤
│ 高灵活性 │ │ 鲁棒低延迟 │
│ 自由视角 │ │ 固定地面视野 │
├──────────────────────┤ ├──────────────────────┤
│ 场景理解 / OCR / │ │ 实时 3D 盲道 │
│ 文字阅读 │ │ 避障规划 │
└──────────────────────┘ └──────────────────────┘
- 边缘大脑(Gemma 4 本地运行):负责高频、高实时的避障与日常隐私场景,物理隔离,断网可用。
- 云端大脑(联网大模型):负责低频、高消耗的深度长文本阅读或全网信息检索,作为本地大脑的后备援军。
| 硬件模块 | 实物图参考 | 规格与作用说明 | 参考价格 |
|---|---|---|---|
| 第一人称视角 (POV) 镜腿微型单目摄像头 |
微型 Type-C 摄像头模组 • 超轻量设计,无缝夹持于普通眼镜镜腿,视角随头部自然转动。 • 负责灵活交互场景(文字 OCR、红绿灯识别、特定物体辨认、通用知识问答)。 |
大约 ¥110 | |
| 边缘计算大脑 | NVIDIA Jetson Orin Nano Dev Kit (8GB) • 系统便携核心,安全收纳于背包/胸包中。 • 提供高达 40 TOPS 的 AI 算力,完美运行量化后的端侧大模型。 |
大约 ¥2599 | |
| 第三人称视角 (FOV) 胸前深度摄像头 |
Orbbec Astra Plus / 微型 HD 摄像头组件 • 嵌入固定于胸包,保持稳定的水平视角。 • 输出实时 3D 深度图,专用于路径导航、跌落检测及低矮障碍物规避。 |
大约 ¥800 | |
| 设备承载胸包 | 四点式战术胸包 • 稳定承载 Jetson 主板、深度摄像头及移动电源,解放双手。 • 保持设备重心贴近身体,适合长时间出行使用。 |
大约 ¥60 | |
| 语音音频输出 | 耳夹式开放耳道微型耳机 • 开放耳道设计,私密播报 AI 语音反馈,同时不阻断环境音感知,保障视障用户出行安全。 |
大约 ¥50 | |
| 能源动力系统 | 大功率 PD 快充移动电源 (20000mAh / 165W) • 人体工学重量分配设计,确保边缘计算机在高吞吐推理负载下持续运行 6 小时以上。 |
大约 ¥200 | |
| 电力诱骗线缆 | Type-C 转 DC 专用高电流诱骗线 • 内置 PD 快充协议诱骗芯片,完美稳压移动电源输出电压以匹配 Jetson 主板标准。 |
大约 ¥20 |
💰 硬件总成本约 ¥3839(以上为 2026 年 7 月开发者实际采购参考价,人民币,仅供预算参考,实际价格随渠道和时间波动)。如果已有 Jetson 板卡,增量成本可控制在 ¥1200 以内。
当前工程原型(MVP)穿戴效果:
VisionLink/
├── src/ # 核心源码(跨平台,15 个模块)
│ ├── platform.py # 平台检测与环境适配
│ ├── config.py # 统一配置中心
│ ├── camera.py # 双摄像头管理(POV 镜腿 + FOV 胸前)
│ ├── detection.py # YOLOv8 实时障碍物检测与深度距离估计
│ ├── inference.py # Ollama 多模态推理(Gemma 4)
│ ├── tts.py # TTS 语音合成(Piper/espeak-ng/edge-tts 三级回退)
│ ├── ui.py # UI 绘制(YOLO 检测框叠加,自动适配无头模式)
│ ├── agent.py # 核心控制中枢(状态机 / 自动模式 / YOLO 回调)
│ ├── prompts.py # Prompt 模板库(中英双语)
│ ├── orbbec_depth.py # Orbbec Astra Plus 深度相机 ctypes 封装
│ ├── volume_control.py # USB 耳麦物理音量按钮监听(evdev + amixer)
│ ├── web_dashboard.py # Web 控制面板(实时状态/日志/控制)
│ ├── web_preview.py # Web 实时画面预览
│ └── dashboard_status.py # 系统状态数据采集
├── apps/ # 应用入口(4 个)
│ ├── desktop.py # Windows/Linux 桌面 GUI 全功能版
│ ├── headless.py # Jetson 无头模式主入口(evdev 全局键盘监听)
│ ├── jetson.py # Jetson 终端键盘兼容版(向后兼容)
│ └── web_app.py # Web 控制面板独立入口
├── scripts/ # 测试与诊断脚本(4 个)
│ ├── check_system.py # 一键系统综合诊断(8 大类检查)
│ ├── check_camera.py # 摄像头扫描与诊断
│ ├── check_audio.py # 音频设备检测与 TTS 测试
│ └── export_yolo_trt.py # YOLOv8 TensorRT 模型导出工具
├── tests/ # 单元测试(pytest)
│ ├── conftest.py # 测试夹具与 mock
│ ├── test_agent.py # Agent 核心逻辑测试
│ ├── test_config.py # 配置模块测试
│ ├── test_detection.py # YOLO 检测模块测试
│ ├── test_platform.py # 平台检测模块测试
│ ├── test_prompts.py # Prompt 模板测试
│ └── test_tts.py # TTS 模块测试
├── .github/workflows/ # CI/CD 自动测试流程
├── start.sh # 一键启动脚本(6 种模式)
├── archive/ # 历史迭代版本
├── assets/ # 静态资源(字体/音频)
├── docs/ # 技术文档
├── Log/ # 运行日志
├── pytest.ini # pytest 配置
├── requirements.txt # 通用依赖
└── requirements-jetson.txt # Jetson 专用依赖
| 特性 | Windows | Jetson |
|---|---|---|
| 模型 | gemma4:e2b |
gemma4:e2b-it-qat |
| AI 分辨率 | 448px | 288px |
| 摄像头 | DSHOW, 单目 | V4L2, 双摄(POV ID=0 + FOV ID=2) |
| TTS | PowerShell SAPI5 | Piper(离线)> espeak-ng > edge-tts |
| 音频设备 | 默认 | AB13X USB Audio (plughw:1,0) |
| UI | 完整面板 | 自动适配无头 / GUI 调试窗口 |
pip install -r requirements.txt
ollama pull gemma4:e2b
python apps/desktop.py
pip install -r requirements-jetson.txt
ollama pull gemma4:e2b-it-qat
# 多种启动方式
./start.sh # 默认:单摄 POV 模式
./start.sh dual # 双摄模式(POV + FOV)
./start.sh full # 全功能模式(双摄 + YOLO 避障)
./start.sh depth # 深度避障模式(双摄 + YOLO + Orbbec 真实深度)
./start.sh gui # 无头模式 + GUI 调试窗口
./start.sh desktop # 桌面 GUI 模式
💡 提示:仅首次拉取模型需要连接网络。后续运行过程中,所有的多模态推理、YOLO 避障与语音合成均 100% 在本地离线完成。
| 触发按键 | 对应功能模式 |
|---|---|
| 按键 1 | 切换至 【YOLO 实时避障模式】(双摄 + 深度距离估计 + 分级语音预警) |
| 按键 2 | 切换至 【文字朗读模式】(OCR + 大模型润色朗读) |
| 按键 3 | 切换至 【场景描述模式】(口语化环境概括) |
| 按键 4 | 切换至 【人脸检测模式】 |
| 按键 5 | 切换至 【图文问答模式】(自由提问) |
| 空格键 (Space) | 触发交互:摄像头拍照 → 本地大模型多模态识别 → 耳机语音播报 |
| M 键 | 切换【自动模式】:定时自动拍照识别 + YOLO 避障 |
| S 键 | 停止当前语音播报 |
| ESC / Q 键 | 退出并安全关闭程序 |
💡 无头模式下使用 evdev 全局键盘监听(自动识别
/dev/input/event*物理键盘),无需窗口焦点即可响应按键。
在无头模式下,USB 耳麦上的物理音量 +/- 按钮默认不生效(ALSA 直连无 HID 事件处理)。现在 src/volume_control.py 通过 evdev 监听 HID 音量键事件,自动调用 amixer 调节声卡音量。
- 自动发现耳麦对应的
/dev/input/event*设备 - 支持热插拔,设备断连后自动重连
- 静默降级:设备未识别时不影响主功能
- 启动时自动运行,无需额外配置
VisionLink 内置 Web 遥测仪表板,在同一局域网的手机/电脑浏览器打开即可实时监控系统运行状态:

访问方式:启动程序后,浏览器打开 http://<Jetson_IP>:5000
功能特性:
| 模块 | 文件 | 功能 |
|---|---|---|
| 数据采集 | src/dashboard_status.py |
线程安全单例,追踪模式/YOLO/深度相机/Ollama 连接状态、推理/检测/TTS 事件日志(环形缓冲区,每种最多 50 条) |
| 硬件遥测 | src/dashboard_status.py |
Jetson 平台 jtop(GPU/CPU/内存/温度),非 Jetson 平台 psutil 降级兜底 |
| Web 仪表板 | src/web_dashboard.py |
Flask 路由 + HTML 页面,暗色终端风格 UI,实时刷新 GPU/CPU/MEM/TEMP 仪表盘、模式状态、事件日志流 |
| 视频推流 | src/web_preview.py |
MJPEG 实时画面推流(/video_feed),后台 daemon 线程,非阻塞运行 |
仪表板页面包含:
- 硬件状态:GPU 使用率、CPU 使用率、内存占用、芯片温度,2 秒刷新
- 应用状态:当前模式、YOLO 开关、深度相机连接、Ollama 连接、自动模式状态
- 实时日志:推理结果(含耗时)、障碍物检测(含危险/预警分级)、TTS 播报记录
- 最新快照:最近一次触发的识别结果与对应画面
项目现已接入 pytest 测试框架,覆盖核心模块:
| 测试文件 | 覆盖模块 |
|---|---|
tests/test_agent.py |
Agent 状态机与核心逻辑 |
tests/test_config.py |
配置加载与校验 |
tests/test_detection.py |
YOLO 检测流程 |
tests/test_platform.py |
平台检测适配 |
tests/test_prompts.py |
Prompt 模板渲染 |
tests/test_tts.py |
TTS 多级回退逻辑 |
# 运行全部测试
pytest tests/ -v
# 运行单个模块测试
pytest tests/test_agent.py -v
CI 通过 .github/workflows/ci.yml 在每次 push 时自动运行测试。
-
Phase 1 (PC Demo):PC端基本流水线跑通,完成三大核心多模态功能调试。
-
Phase 2 (边缘移植):将代码成功移植至 Jetson Orin Nano (8GB),通过 INT4/INT8 量化降低内存占用。
-
Phase 3 (工程化重构):模块化代码架构,双平台统一接口,无头模式支持。
-
Phase 4 (硬件联调):完成镜腿微型 Type-C 摄像头原型制作,初步验证 POV 图像采集稳定性。
-
Phase 5 (工程封装):完成 YOLOv8 实时避障 + 深度距离估计 + 双视角融合,无头模式全局键盘交互。
-
Phase 5.5 (体验打磨):USB 耳麦物理音量按钮支持、Web 控制面板与实时画面预览、pytest 单元测试体系与 CI/CD 自动流程、Orbbec 深度避障模式。
-
Phase 6 (工业设计):完成 3D 打印尼龙人体工学挂脖/背包打样,推出商业级 MVP 样机。
-
Phase 7 (场景外溢):横向跨界,平移至无网工业巡检机器人、失智老人健康看护等垂直市场。
- 本项目基于 MIT License 开源协议,允许商用、二次修改与分发。
- 特别感谢 Google Hackathon 提供的技术展示舞台。
============ End

浙公网安备 33010602011771号