前言OpenDriveVLA 是当前自动驾驶领域最受关注的视觉语言动作Vision-Language-Action模型之一基于 Qwen2.5 系列大模型构建能够直接从多模态输入图像、文本指令输出端到端的驾驶轨迹。本文将带你从零完成 OpenDriveVLA 的环境部署与推理验证重点解决国内模型下载受限、分布式启动报错等问题。一、系统与硬件要求操作系统Ubuntu 20.04/22.04推荐显卡NVIDIA GPU推荐 16GB 运行 0.5B 模型CUDA 版本12.2与官方指定PyTorch 2.1.2兼容Python 版本3.10官方指定避免依赖冲突二、模型下载国内镜像高速方案直接从 Hugging Face 官网下载模型受限本文使用国内镜像站hf-mirror.com实现满速下载。2.1 配置国内镜像环境变量# 临时生效仅当前终端exportHF_ENDPOINThttps://hf-mirror.com# 永久生效推荐写入bashrcechoexport HF_ENDPOINThttps://hf-mirror.com~/.bashrcsource~/.bashrc2.2 安装 Hugging Face 命令行工具pipinstall-Uhuggingface_hub2.3 输入HuggingFace token2.4 下载预训练模型huggingface-cli download\--resume-download\OpenDriveVLA/DriveVLA-Qwen2.5-0.5B-Instruct\--local-dir checkpoints/DriveVLA-Qwen2.5-0.5B-Instruct\--local-dir-use-symlinks False参数说明resume-download支持断点续传网络中断后重新运行即可继续local-dir-use-symlinks False禁用软链接下载文件直接保存到指定目录三、模型推理运行两种方式3.1 推荐一键脚本运行最稳定官方提供了完整的推理 评估脚本自动处理所有路径和环境变量是最不容易出错的方式。# 确保在项目根目录执行cdOpenDriveVLA# 运行推理脚本参数1模型路径 参数2使用的GPU数量bashscripts/eval_drivevla.sh checkpoints/DriveVLA-Qwen2.5-0.5B-Instruct1脚本会自动完成以下操作– 创建带时间戳的唯一输出目录– 用 torchrun 正确启动分布式推理– 保存推理结果到output/模型名称/时间戳/results/plan_conv.json– 自动运行评估脚本3.2 手动分步运行适合调试如果需要单独调试推理流程可按以下步骤执行注意绝对不能直接用 python 启动。步骤 1设置 Python 路径否则提示找不到projects路径exportPYTHONPATH$PWD:$PYTHONPATH步骤 2用 torchrun 启动推理torchrun--nproc_per_node1drivevla/inference_drivevla.py\--num-workers4\--bf16\--model-path checkpoints/DriveVLA-Qwen2.5-0.5B-Instruct\--outputoutput/plan_conv.json关键注意事项必须用torchrun而非直接python启动原因见下文原理部分–nproc_per_node1表示使用 1 张 GPU多卡环境改为对应数量即可–output必须指定具体的 JSON 文件路径不能是文件夹否则会报错3.3 单卡3090推理时显存占用四、为什么必须用 torchrun 启动torchrun是 PyTorch 官方提供的分布式任务启动器在 LLM 推理和训练中扮演着关键角色其作用在不同场景下有所不同4.1 训练场景数据并行– 每张显卡复制一份完整模型– 不同显卡处理不同批次的数据– 最后汇总梯度更新模型参数核心目的加速训练过程4.2 推理场景模型并行– 大模型无法完整加载到单张显卡– 将模型的不同层注意力层、全连接层等拆分到多张 GPU– 数据在多张卡之间流转完成推理核心目的解决单卡显存不足问题4.3 直接用 python 启动的问题OpenDriveVLA 的推理代码内置了 DeepSpeed 分布式支持直接用python运行会– 触发 DeepSpeed 自动初始化流程– 尝试检测 MPI 环境– 最终抛出ModuleNotFoundError: No module named mpi4py’错误而用torchrun启动会正确初始化 PyTorch 原生分布式环境绕过 MPI 依赖让推理正常运行。五、总结本文完整介绍了 OpenDriveVLA 的环境部署与推理流程核心要点总结国内下载模型必须配置HF_ENDPOINThttps://hf-mirror.com镜像推理必须用torchrun启动绝对不能直接用python测试模型只需跑推理可跳过评估步骤避免数据集依赖CSDN 标签建议自动驾驶、大模型、OpenDriveVLA、视觉语言模型、环境部署、PyTorch、torchrun、Hugging Face本文为CSDN原创转载请注明出处。