免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

RAG系统工程师的日常——从数据合成到推理部署的全链路

RAG系统工程师的日常——从数据合成到推理部署的全链路 01 为什么要盯着宏观演变垂域RAG工程师的日常工作很具体解析文档、调检索、训模型、部署服务。看起来和万亿参数原生多模态这些宏观叙事离得很远。但宏观演变决定了日常工作的边界三个必要性很实际。避免在过时的技术栈上造轮子。基座模型能力弱的时候遇到行业术语和复杂逻辑只能花大力气收集数据做微调。现在模型上下文到了百万级、上下文学习能力极强很多过去需要微调解决的知识注入问题用RAG加提示词工程就能解决。不了解这个变化就可能在数据标注和微调上浪费数月。捕获架构红利解决RAG的老痛点。RAG系统的核心痛点是召回不准和复杂问题推理失败。长上下文、深度推理、工具调用这些能力的演进恰好提供了新武器——比如用推理模型作为RAG的大脑自主拆解问题、多跳检索这就是Agentic RAG的路径。重新定义垂域护城河。通用模型越来越强垂域系统的壁垒不再是懂几个行业名词而是私有的高质量行业数据资产以及与行业工作流的无缝嵌入。精力该从调参炼丹转向数据工程和链路设计。看清方向之后问题落到更具体的一层日常工作究竟怎么组织。两条线索可以把它看清楚——纵向的依赖层级横向的五个工作阶段。02 纵向依赖层级的五层RAG工程师面对的依赖栈从底向上是五层┌─────────────────────────────────────────┐ │ 应用层vLLM / SGLang / RAG 业务代码 │ ├─────────────────────────────────────────┤ │ 框架层PyTorch │ ├─────────────────────────────────────────┤ │ CUDA层CUDA Toolkit / cuDNN │ ├─────────────────────────────────────────┤ │ 驱动层NVIDIA Driver │ ├─────────────────────────────────────────┤ │ 硬件层GPUA100 / L40S / ... │ └─────────────────────────────────────────┘硬件层物理算力。日常关心有几张卡、显存多大——这直接决定能跑多大的模型、开多大的并发。驱动层NVIDIA Driver操作系统与GPU之间的翻译。日常只需确认nvidia-smi能识别GPU装好后不再变动。CUDA层框架调用GPU算力的桥梁。关心点是版本要和PyTorch匹配FlashAttention等算子库的编译依赖它。框架层PyTorch。关心点是版本要支持目标模型架构新模型往往需要较新的框架。应用层vLLM等推理框架和自己的RAG业务代码日常打交道最多。在这个栈上有四条被反复验证的原则。底层稳定不动。Driver是全局共享的地基装好后不轻易升级。地基动一次上面所有环境都可能塌。中层按需匹配。Driver决定能用的CUDA上限CUDA Toolkit按环境装不同版本但不能超过上限PyTorch严格匹配CUDA版本。绝大多数GPU用不了的问题都出在这三者的版本错位上。上层灵活但锁定。应用层库更新频繁不同项目需求不同依赖清单要固化成文件保证可复现、可回滚。出问题自底向上排查。先确认nvidia-smi能看到GPU再确认torch.cuda.is_available()为True再看应用层报错。分层排除的效率远高于遇到报错就全网搜索零散解法。03 横向五个工作阶段一个完整的RAG系统要经历五个阶段。每个阶段的任务性质、工具链、产出物都不同。阶段一数据合成与处理。把行业原始文档变成可用的数据资产。文档解析、文本切片、调用强模型批量合成QA训练数据、清洗去重。产出是干净的文档文本进知识库和QA数据集给训练用。这一步的质量决定整个系统的上限——文档解析丢掉的表格结构下游永远找不回来。脏数据的另一个特点是隐蔽问题往往到检索或生成环节才暴露但根子在数据。阶段二小模型训练。微调检索链路的两个关键模型Embedding模型负责召回Reranker模型负责精排。它们参数不大单卡训练几小时但对检索精度的提升常常超过调一个月提示词。选型上文本检索以Qwen3-Embedding、BGE等开源模型为主流知识库含大量图片图表时可选多模态Embedding模型把文本和图像编码到统一向量空间实现以文搜图。训练数据来自阶段一的合成QA。产出是微调后的模型权重交给阶段四。阶段三大模型微调。让通用大模型适应行业语言和输出规范。垂域SFT的主要目的不是让模型学会新知识——知识交给RAG检索更合适——而是学会用行业的方式说话。常规做法是LoRA只训练少量参数基座模型不动可叠加、易回滚。需要多卡、DeepSpeed省显存、FlashAttention加速以及足够新的框架版本支持新模型架构。数据配比上垂域数据之外要保留一定比例的通用数据避免模型学会行业话的同时丢掉通用能力。产出是LoRA权重交给阶段五部署。阶段四RAG链路开发。把检索和生成串成完整问答流程用户提问 → Query处理改写/扩展 → 混合检索向量检索用阶段二的Embedding 关键词检索BM25 → Reranker精排用阶段二的Reranker → 拼装Prompt系统提示 检索结果 用户问题 → 调用大模型生成回答用阶段五部署的API → 返回答案混合检索的存在有一个很实际的原因垂域专有名词靠语义往往搜不到必须靠关键词精确命中补齐两路结果互补。这个阶段以集成和调试为主迭代最频繁——调检索策略、改Prompt、跑评估每天可能改好几轮。阶段五推理部署服务化。把模型部署成稳定的API服务供链路调用。用Docker不用Conda——推理框架的依赖复杂且严格官方镜像已预配好一切容器化也让多模型多版本共存、崩溃自动重启、服务编排成为标配。04 部署专项几件确定性高的事推理部署是链路的最末端也是工程取舍最集中的地方。有几件事的确定性很高值得优先做。量化是第一优化。把模型权重从FP16压到INT4显存占用减半、推理速度提升对几十B级别的模型精度损失通常在可接受范围内。这是成本最低、收益最高的部署优化。Prefix Caching是RAG场景的杀手级优化。RAG请求天然带有很长的共享前缀——系统提示加上检索注入的上下文。开启前缀缓存后相同前缀的请求跳过重复的预填充计算首token延迟可下降一半以上。盯两个延迟指标。TTFT首token延迟是用户感知的响应速度TPOT每token延迟是用户感知的生成速度。RAG场景通常TTFT更要紧——用户等着看答案。监控不是可选项。QPS、延迟、显存占用、错误率上线就必须有数据。没有监控的部署出问题后无法定位瓶颈。05 环境管理五个环境互不干扰为什么每个阶段要一个独立环境因为它们的依赖互相冲突微调新模型要最新版框架小模型训练求稳定要锁旧版推理部署的推理框架自带一套严格锁定的依赖。全塞进一个环境就是依赖地狱。各阶段对环境的诉求可以概括为四句话训练求稳定一次跑数小时框架固定在验证过的组合上、微调求兼容必须上较新的框架版本支持新模型架构、部署求不变生产环境跑几个月不动、开发求灵活快速试验新方案但依赖清单留底可回滚。典型的划分data-synth跑数据处理small-train训Embedding和Rerankerllm-finetune微调大模型rag-dev开发链路推理部署交给Docker。日常就是在环境间切换——上午处理数据下午训练模型傍晚调链路。阶段之间不共享环境靠契约传递成果数据阶段交出固定格式的数据集文件训练阶段交出标准格式的模型权重部署阶段提供标准化的API接口。只要契约不变每个阶段内部怎么改都不影响其他阶段。换训练框架、升级推理引擎、重做数据集都是局部动作。06 收束迭代循环把五阶段连起来就是一个典型的迭代周期拿到新的行业文档解析、清洗、合成训练数据检索不够好微调Embedding和Reranker回答风格不符行业要求LoRA微调大模型在链路里反复调策略、跑评估效果达标后Docker部署上线上线后持续监控、收集badcase回到起点开始下一轮。RAG工程师的日常就是在这五个阶段之间循环迭代。环境隔离让迭代互不干扰契约传递让协作界面清晰评估监控让每轮迭代有据可依。这张地图的价值还在于工作推进不顺时先定位自己站在地图的哪个位置——是数据阶段的解析质量问题还是训练阶段的模型能力问题是链路阶段的策略问题还是部署阶段的性能问题。位置清楚了解法自然就清楚了。最终决定系统成败的不是追了多新的模型而是数据质量、检索精度和链路与业务的贴合度——这些恰好都是每天手里在做的事。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表