
前言智能总结这篇文章深入探讨了如何通过微调技术来优化大语言模型如DeepSeek的表现使其在特定领域或任务中更具优势。文章首先解释了微调的必要性及其在特定领域中的应用场景并将微调与长文本处理、知识库的使用进行对比帮助读者理解何时选择微调。接着文章详细介绍了微调的基本流程包括选择预训练模型、准备数据集、设置超参数等。通过硅基流动平台读者可以体验在线微调的流程。最后文章提供了一个使用Colab和Unsloth工具进行本地微调的实战指南展示了如何从头到尾微调一个算命大师模型并将其部署到本地环境中使用。学习要点理解微调的概念及其在特定任务中的重要性。掌握微调与长文本处理、知识库的区别和应用场景。熟悉微调的基本流程包括选择预训练模型、准备数据集和设置超参数。了解如何使用Colab和Unsloth工具进行本地微调。学会将微调后的模型上传到Hugging Face并在本地通过Ollama运行。表示本地部署 知识库并不能很好的满足一些需求场景另外我还看到很多同学对于大模型的理解还存在一些误解以为本地模型知识库就是在 “训练“ 自己的模型。为了解答大家的问题今天我们一起来聊聊大模型的进阶使用“模型微调” 也就是较大家真正的 “调教“ 出一个能够满足特定需求场景、更贴合个人使用习惯的个性化模型。最近 “大模型算命” 很火我们今天的例子就以 “算命” 为主题教大家微调出一个更专业的 “算命大师” 模型。我们先看看微调前后的效果对比相信很多同学看到 “微调” 这个概念就有点想劝退了觉得这已经属于比较深度的技术了但我想告诉大家其实微调并不会有大家想象中那么复杂尤其是在 DeepSeek 热潮开始后AI 开源社区和工具已经越来越成熟和发达即使是非专业的技术爱好者也能做到轻松上手。为什么需要微调在开始学习微调之前大家首先还是要搞清楚为什么要微调在什么情况下需要微调我们平常接触到的大模型如 GPT、DeepSeek 等都是基于海量的通用数据训练而成的它们具备非常强大的语言理解和生成能力能够处理多种自然语言任务。但是这些模型在某些特定领域或任务上的表现可能并不理想或者说还能够做到表现的更好。下面是需要微调的几个主要原因让模型更懂“专业话”通用模型就像一个“万事通”它学过很多东西但对一些特别专业的领域比如医学、法律、金融可能不会特别精通。通过微调我们可以给模型“补课”让它学会这些专业领域的知识从而在这些领域表现得更好。让模型适应不同的“工作”不同的任务对模型的要求不一样。比如有些任务需要模型判断一段文字是好是坏比如评论是正面还是负面这就需要模型输出一个明确的答案而有些任务需要模型写一篇文章或者回答问题这就需要模型生成流畅、连贯的文字。微调可以让模型根据任务的需求调整自己的能力更好地完成这些“工作”。让模型表现得更“平衡”通用模型在很多通用任务上表现不错但在一些特定任务上可能会“失衡”。比如它可能会对某些问题过于敏感或者对某些问题反应不够。通过微调我们可以调整模型的“参数”就像调整汽车的引擎一样让它在特定任务上表现得更“平衡”。保护数据的隐私和安全有时候我们的数据可能包含一些敏感信息比如公司的机密文件或者个人隐私。这些数据不能随便上传到云端否则可能会泄露。微调允许我们在自己的电脑或服务器上训练模型这样数据就一直掌握在自己手里不用担心泄露。节省时间和成本如果从头开始训练一个模型就像从零开始盖一座房子需要很多时间和资源。而微调就像是在现成的房子里进行装修只需要调整一下细节就可以让它更适合自己的需求。这样不仅节省时间和成本而且微调后的模型在特定任务上表现更好用起来也更高效。下面是几个可能需要用到微调的需求场景定制模型的风格和语气训练一个文案生成模型让它以一种幽默、轻松的风格撰写广告文案。让模型的回答更靠谱训练一个医学问答模型让它根据症状给出准确的医疗建议。让模型理解复杂的指令用户输入复杂的提示如生辰八字、面相、手相等模型需要根据这些提示给出符合算命逻辑的回答。让模型处理特殊情况训练一个法律咨询模型让它处理一些特殊的边缘情况如“未成年人的合同效力”。让模型学会新技能训练一个心理咨询模型让它学会一种新技能——情绪疏导。长文本 知识库 微调的区别现在各大模型都支持超长上下文从最开始的4K到现在的200K我们不能用一个比较完善的提示词来解决这些问题吗现在各种知识库工具这么灵活我们不能自己搭建一个非常全面的数据库来解决这些问题吗这可能会是很多小伙伴存在的疑问下面我们就来看看长文本、知识库、微调究竟有什么区别我们又该在什么场景下做什么样的选择呢为了方便大家理解我们后面把模型回答一个问题类比为参加一场考试。长文本通俗理解你参加了一场考试题目是一篇超长的阅读理解。这篇文章内容很多可能有几千字你需要在读完后回答一些问题。这就像是“长文本”的任务。模型需要处理很长的文本内容理解其中的细节和逻辑然后给出准确的答案。比如模型要读完一篇长篇小说然后回答关于小说情节的问题。优点连贯性强能够生成或理解长篇幅的内容保持逻辑和语义的连贯性。适合复杂任务适合处理需要深入理解背景信息的任务比如长篇阅读理解或复杂的文章生成。缺点资源消耗大处理长文本需要更多的计算资源和内存因为模型需要同时处理大量信息。上下文限制即使是强大的模型也可能因为上下文长度限制而丢失一些细节信息。适用场景写作助手生成长篇博客、报告或故事。阅读理解处理长篇阅读理解任务比如学术论文或小说。对话系统在需要长篇回答的场景中比如解释复杂的概念。知识库通俗理解你参加的是一场开卷考试你可以带一本厚厚的资料书进去。考试的时候你可以随时翻阅这本资料书找到你需要的信息来回答问题。这就像是“知识库”的作用。知识库就像是一个巨大的资料库模型可以在里面查找信息然后结合这些信息来回答问题。比如你问模型“爱因斯坦的相对论是什么”模型可以去知识库中查找相关内容然后给出详细的解释。优点灵活性高可以随时更新知识库中的内容让模型获取最新的信息。扩展性强不需要重新训练模型只需要更新知识库就能让模型回答新的问题。缺点依赖检索如果知识库中的信息不准确或不完整模型的回答也会受影响。实时性要求高需要快速检索和整合知识库中的信息对性能有一定要求。适用场景智能客服快速查找解决方案回答用户的问题。问答系统结合知识库回答复杂的、需要背景知识的问题。研究辅助帮助研究人员快速查找相关文献或数据。微调通俗理解你在考试之前参加了一个课外辅导班专门学习了考试相关的知识和技巧。这个辅导班帮你复习了重点内容还教你如何更好地答题。这就像是“微调”。微调是让模型提前学习一些特定的知识比如某个领域的专业术语或者特定任务的技巧这样它在考试也就是实际任务中就能表现得更好。比如你让模型学习了医学知识那么它在回答医学相关的问题时就能更准确。优点性能提升显著提升模型在特定任务或领域的表现。定制化强可以根据需求调整模型的行为比如改变回答风格或优化任务性能。缺点需要标注数据需要准备特定领域的标注数据这可能需要时间和精力。硬件要求高微调需要一定的计算资源尤其是 GPU。适用场景专业领域如医疗、法律、金融等让模型理解专业术语和逻辑。特定任务如文本分类、情感分析等优化模型的性能。风格定制让模型生成符合某种风格的内容比如幽默、正式或古风。对比对比维度长文本处理知识库微调核心目标理解和生成长篇内容提供背景知识增强回答能力优化模型在特定任务或领域的表现优点连贯性强适合复杂任务灵活性高可随时更新性能提升定制化强缺点资源消耗大上下文限制依赖检索实时性要求高需要标注数据硬件要求高适用场景写作助手、阅读理解智能客服、问答系统专业领域、特定任务、风格定制额外数据不需要但可能需要优化上下文长度需要知识库数据需要特定领域的标注数据重新训练不需要但可能需要优化模型不需要只需更新知识库需要对模型进行进一步训练技术实现扩大上下文窗口检索生成RAG调整模型参数数据依赖无需额外数据依赖结构化知识库需要大量标注数据实时性静态依赖输入内容动态知识库可随时更新静态训练后固定资源消耗高长文本计算成本高中需维护检索系统高训练算力需求大灵活性中适合单次长内容分析高可扩展多知识库低需重新训练适应变化微调的基本流程以下是一个常见的模型微调的过程选定一款用于微调的预训练模型并加载准备好用于模型微调的数据集并加载准备一些问题对微调前的模型进行测试用于后续对比设定模型微调需要的超参数执行模型微调训练还使用上面的问题对微调后的模型进行测试并对比效果如果效果不满意继续调整前面的数据集以及各种超参数直到达到满意效果得到微调好的模型在这个流程里有几个基本概念需要大家提前了解我们还用上面考试的例子举例微调模型的过程就像是给一个已经很聪明的学生“补课”让他在某个特定领域变得更擅长。概念1预训练模型预训练模型就是我们选择用来微调的基础模型就像是一个已经受过基础教育的学生具备了基本的阅读、写作和理解能力。这些模型如GPT、DeepSeek等已经在大量的通用数据上进行了训练能够处理多种语言任务。选择一个合适的预训练模型是微调的第一步。一般来说为了成本和运行效率考虑我们都会选择一些开源的小参数模型来进行微调比如Mate的llama、阿里的qwen以及最近爆火的DeepSeek蒸馏版概念2数据集数据集就是我们用于模型微调的数据就像是“补课”时用的教材它包含了特定领域的知识和任务要求。这些数据需要经过标注和整理以便模型能够学习到特定领域的模式和规律。比如如果我们想让模型学会算命就需要准备一些标注好的命理学知识作为数据集。一般情况下用于模型训练的数据集是没有对格式强要求的比如常见的结构化数据格式JSON、CSV、XML 都是支持的。数据集中的数据格式也没有强要求一般和我们日常与 AI 的对话类似都会包括输入、输出比如下面就是一个最简单的数据集为了模型的训练效果有时候我们也会为数据集添加更丰富的上下文比如在下面的数据集中以消息messages进行组织增加了 System系统消息类似于角色设定user用户消息、assistant助手回复消息的定义这样就可以支持存放多轮对话的数据这也是 OPEN AI 官方推荐的数据集格式大家练习或测试的话可以去网上找一些公开数据集这里推荐两个可以获取公开数据集的网站第一个Hugging Face我们可以把 Hugging Face 平台比作 AI 领域的GitHub它为开发者提供了一个集中化的平台用于分享、获取和使用预训练模型和数据集。就像GitHub是代码共享和协作的中心一样Hugging Face是AI模型和数据共享的中心。在后面的实战环节中我们还会用到它https://huggingface.co/datasets如果你没有也可以退而求其次选择国内的一些类似社区比如 GitCode 的 AI 社区https://ai.gitcode.com/datasets概念3超参数超参数就像是你在给模型 “补课” 之前制定的教学计划和策略。它们决定了你如何教学、教学的强度以及教学的方向。如果你选择的教学计划不合适比如补课时间太短、讲解速度太快或复习策略不合理可能会导致学生学习效果不好。同样如果你选择的超参数不合适模型的性能也可能不理想。一些关键的超参数的含义我们将在后面的实战中继续讲解。初识通过平台微调大模型目前市面上很多 AI 相关平台都提供了在线微调模型的能力比如我们以最近比较火的硅基流动为例https://docs.siliconflow.cn/cn/userguide/guides/fine-tune我们进入硅基流动后台的第二项功能就是模型微调选择预训练模型我们尝试新建一个微调任务可以看到目前硅基流动支持微调的模型还不是很多而且也没看到 DeepSeek 相关模型这里我们选择Qwen2.5-7B来测试一下选择预训练模型准备数据集下一步就是选择数据集上传数据集我们目前硅基流动仅支持 .jsonl 格式的数据集JSONL文件JSON Lines是一种特殊的 JSON 格式每一行是一个独立的 JSON 对象JSONL 文件是“扁平化”的彼此之间没有嵌套关系。且需符合以下要求jsonl 格式说明看着挺复杂的其实和我们上面介绍的OPEN AI官方推荐的数据集格式要求是一样的对应 jsonl 的数据就是这样验证数据集数据集上传完成后下一步就是输入一个微调后模型的名字以及设置验证数据集。首先我们想要微调一个算命大师模型那我们就以 fortunetelling 来命名然后就是验证数据集验证数据集就是从我们的整体数据中划分出来的一部分数据。它通常占总数据的一小部分比如 10%~20%。这部分数据在训练过程中不会被用来直接训练模型而是用来评估模型在未见过的数据上的表现。简单来说验证数据集就像是一个“模拟考试”用来检查模型是否真正学会了知识而不是只是“背诵”了训练数据。这里我们选择默认的10%即可。超参数设置最后就是设置一些模型训练的 “超参数” 了给出可以设置的参数非常多我们这里只介绍最关键的三个参数为了方便理解我们还以考试前复习的例子来进行讲解假设你正在准备一场重要的考试你有一本厚厚的复习资料书里面有 1000 道题目。你需要通过复习这些题目来掌握考试内容。训练轮数Number of EpochsEpoch 是机器学习中用于描述模型训练过程的一个术语指的是模型完整地遍历一次整个训练数据集的次数。换句话说一个Epoch表示模型已经看到了所有训练样本一次。通俗来说训练轮数就是我们从头到尾复习这本书的次数。轮数少比如你只复习一遍可能对书里的内容还不是很熟悉考试成绩可能不会太理想。轮数多比如你复习了 10 遍对书里的内容就很熟悉了但可能会出现一个问题——你对书里的内容背得很熟但遇到新的、类似的问题就不会解答了简单讲就是 “学傻了“只记住这本书里的内容了稍微变一变就不会了过拟合。学习率Learning Rate决定了模型在每次更新时参数调整的幅度通常在 (0, 1) 之间。也就是告诉模型在训练过程中 “学习” 的速度有多快。学习率越大模型每次调整的幅度就越大学习率越小调整的幅度就越小。通俗来说学习率可以用来控制复习的“深度”确保不会因为调整幅度过大而走偏也不会因为调整幅度过小而进步太慢。如果你每次复习完一道题后你会根据答案和解析调整自己的理解和方法。学习率大比如0.1每次做完一道题后你会对解题方法进行很大的调整。比如你可能会完全改变解题思路。优点是进步可能很快因为你每次都在进行较大的调整。缺点就是可能会因为调整幅度过大而“走偏”比如突然改变了一个已经掌握得很好的方法导致之前学的东西都忘了。学习率小比如0.0001每次做完一道题后你只对解题方法进行非常细微的调整。比如你发现某个步骤有点小错误就只调整那个小错误。优点是非常稳定不会因为一次错误而“走偏”适合需要精细调整的场景。缺点就是进步会很慢因为你每次只调整一点点。批量大小Batch Size是指在模型训练过程中每次更新模型参数时所使用的样本数量。它是训练数据被分割成的小块模型每次处理一个小块的数据来更新参数。通俗来说批量大小可以用来平衡复习速度和专注度确保既能快速推进复习进度又能专注细节。假设你决定每次复习时集中精力做一定数量的题目而不是一次只做一道题。批量大比如100每次复习时你集中精力做100道题。优点是复习速度很快因为你每次处理很多题目能快速了解整体情况。缺点是可能会因为一次处理太多题目而感到压力过大甚至错过一些细节。批量小比如1每次复习时你只做一道题做完后再做下一道。优点是可以非常专注能仔细分析每道题的细节适合需要深入理解的场景。缺点就是复习速度很慢因为每次只处理一道题。在实际的微调场景中我们需要通过一次次的调整这些参数最后验证对比模型效果来产出效果最好的微调模型。当然如果你是小白用户这些参数简单理解就行了刚开始不需要调整这些参数默认推荐的一般可以满足大部分场景的需求。微调后调用微调完成后我们可以得到一个微调后模型的标识符后续我们可以通过接口/chat/completions即可直接调用微调后的模型fromopenaiimportOpenAI clientOpenAI(api_key您的 APIKEY,# 从https://cloud.siliconflow.cn/account/ak获取base_urlhttps://api.siliconflow.cn/v1)messages[{role:user,content:用当前语言解释微调模型流程},]responseclient.chat.completions.create(model您的微调模型名,messagesmessages,streamTrue,max_tokens4096)forchunkinresponse:print(chunk.choices[0].delta.content,end)我们现在已经了解了模型微调需要的大部分基础概念也通过硅基流动平台走完了一个完整的微调流程但是在这个过程中我们发现有几个问题可以选择的基础模型太少了没有我们想要的 DeepSeek 相关模型模型训练过程中的 Token 消耗是要自己花钱的对于有海量数据集的任务可能消耗比较大微调任务触发不太可控作者在测试的时候创建的微调任务等了一天还没有被触发当然这可能是硅基流动最近调用量太大资源不足的问题换成其他平台比如 OPEN AI Platfrom可能好一点但是总归这个任务还是不太可控的。为了解决这个问题最终我们还是要使用代码来微调这样我们就能灵活选择各种开源模型无需担心训练过程中的 Token 损耗灵活的控制微调任务了。当然看到这里不会写代码的同学也不要放弃因为前面大部分的概念我们已经了解过了下面我会尽可能的让大家在不懂代码的情况下也能完整运行这个过程。进阶要了解的工具在开始实战之前我们先了解后续模型微调过程中需要用到的两个核心工具Colab和unsloth。ColabColab是一个基于云端的编程环境由 Google 提供。它的主要功能和优势包括免费的 GPU 资源Colab 提供免费的 GPU适合进行模型微调。虽然免费资源有一定时间限制但对于大多数微调任务来说已经足够。易于上手Colab 提供了一个基于网页的 Jupyter Notebook 环境用户无需安装任何软件直接在浏览器中操作。丰富的社区支持Colab 上有许多现成的代码示例和教程可以帮助新手快速入门。简单来说有了Colab可以让你没有在比较好的硬件资源的情况下能够在线上微调模型如果只是学习的话免费的资源就够了。另外市面上很多模型微调的 DEMO 都是通过Colab给出的大家可以非常方便的直接进行调试运行。unslothUnsloth是一个开源工具专门用来加速大语言模型LLMs的微调过程。它的主要功能和优势包括高效微调Unsloth 的微调速度比传统方法快 2-5 倍内存占用减少 50%-80%。这意味着你可以用更少的资源完成微调任务。低显存需求即使是消费级 GPU如 RTX 3090也能轻松运行 Unsloth。例如仅需 7GB 显存就可以训练 1.5B 参数的模型。支持多种模型和量化Unsloth 支持 Llama、Mistral、Phi、Gemma 等主流模型并且通过动态 4-bit 量化技术显著降低显存占用同时几乎不损失模型精度。开源与免费Unsloth 提供免费的 Colab Notebook用户只需添加数据集并运行代码即可完成微调。简单来说Unsloth采用了某些优化技术可以帮助我们在比较低级的硬件设备资源下更高效的微调模型。在Unsloth出现之前模型微调的成本非常高普通人根本就别想了微调一次模型至少需要几万元几天的时间才能完成。我们看到Unsloth官方提供了很多通过Colab提供的各种模型的微调案例我们可以很方便的在Colab上直接运行这些案例但是在官方的示例中我们没有找到 DeepSeek R1 模型的微调案例不过我找到了官方的一段介绍我们可以直接在现有案例中直接将模型名称进行替换就可以运行DeepSeek R1推理模型的微调不过在实际运行中我发现还需要调整数据集的格式以及一些参数这个我们后面具体讲解。下面我们就用一个实际的例子微调算命大师模型来带大家走一遍这个过程大家只需要跟随我把每个步骤里的代码复制到自己的Colab里运行即可期间大家只需要自己调整一些关键的部分例如数据集和测试问题等等。实战使用 unsloth 微调算命大师模型在开始前我们再回顾下前面我们总结的微调的基本流程在下面的案例中流程基本也是一样的第一步创建环境、安装依赖这里推荐大家创建一个自己的空白Colab环境来一步步将我的代码贴进去执行。大家可以访问这个链接需要https://colab.research.google.com/#createtrue然后我们更改一下运行时类型在 Colab 中用于执行代码的计算资源类型其决定了你的代码运行时会使用哪种硬件支持。将运行时类型改为 T4 GPUNVIDIA推出的一款高性能 GPU特别适合深度学习任务然后我们执行第一段最简单的代码主要功能是安装一些 Python 包和库这些库是运行 AI 模型微调任务所必需的工具。第二步加载预训练模型下一步就是要加载一个预训练模型可以看到这里的参数是model_name然后我们选择的是DeepSeek-R1-Distill-Llama-8B基于 Llama 的 DeepSeek-R1 蒸馏版本80 亿参数如果大家想更换成其他的模型直接改这个参数即可比如可以改成unsloth/DeepSeek-R1-Distill-Qwen-7然后运行代码我们可以看到模型的拉取日志选择了解4bit 量化4bit Quantization一种技术通过减少模型的精度来节省内存就像把一个大箱子压缩成一个小箱子方便携带。第三步微调前测试在开始微调之前我们先用一个算命相关的问题来测试一下方便我们在训练完后进行对比。首先我们定义问题这里大家可以自行更改比如你想要训练一个医学相关大模型那这里就改成看病相关的问题然后我们调用模型进行推理并打印出推理结果这里完全不需要大家改照搬就行微调前输出的结果可以看到现在模型给的结果比较简单也没有 “大师” 的语气风格。第四步加载数据集首先我们把这个数据集预期要训练出来的模型风格定义出来这里大家也可以自行更改比如你想要训练一个医学相关大模型那这里就改成专业医生相关的描述下面我们要准备一个用于微调的数据集大家可以去前面提到的HuggingFace上搜索符合自己需求的数据集命理相关的数据集比较少这里我自己生成了一些然后上传到HuggingFace了大家有需要的可以自取https://huggingface.co/datasets/Conard/fortune-telling/viewer/default/train需要注意的是这里字段格式和前面提到的格式略有区别除了包含基本的问题Question、回答Response还包含了模型的思考过程Complex_CoT因为我们现在要训练的是一个推理模型所以数据集中最好也要包含模型的思考过程这样训练出来的推理模型效果更好。下面我们看看加载数据集的代码我们把数据集加载进来然后打印出数据集包含的字段名这里重点关注load_dataset函数的几个参数数据集的名称默认会从 HuggingFace 拉取数据集的语言以及取数据集的哪部分数据用作训练。然后我们对数据集进行一些格式化再打印一条出来看看目前所有准备工作已经完成下一步就是开始微调训练。第六步执行微调在这一步我们需要设置各种关键参数我们把关键代码分为三段第一段模型微调准备这段代码是通过 LoRA 技术对预训练模型进行了微调准备使其能够在特定任务上进行高效的训练同时保留预训练模型的大部分知识。LoRA 我们在这篇文章中不做深度讲解大家先了解即可参数也先不用改。第二段配置微调参数在这段代码中包括一大堆参数不需要大家都理解我们只需要关注上面我们已经介绍过的三个参数学习率Learning Rate通过TrainingArguments中的learning_rate参数设置的这里的值为2e-4即 0.0002。批量大小Batch Size由两个参数共同决定实际的批量大小per_device_train_batch_size * gradient_accumulation_steps也就是2 * 4 8per_device_train_batch_size每个设备如 GPU上的批量大小。gradient_accumulation_steps梯度累积步数用于模拟更大的批量大小。训练轮数Epochs通过max_steps(最大训练步数) 和数据集大小计算得出在这段代码中最大训练 70 步每一步训练 8 个数据集大小为 200那训练论数就是70 * 8 / 200 3我们来看最后一段代码执行训练这段代码非常简单就一行我们执行后可以看到一些关键参数比如训练轮数、批量大小等也可以看到每一步训练的进度。第七步微调后测试微调训练完成后我们测试运行一下还使用和之前一模一样的问题回答效果可以发现回答效果专业了很多说明本次训练是有效果的。实战本地运行微调后的算命大师模型现在我们已经在 Colab 上完成了完整的模型微调训练过程下一步就是使用我们微调后的模型了在之前的文章中我们学习了如何使用Ollama运行Ollama平台上的开源模型其实Ollama也是可以支持直接从Hugging Face上拉取并运行模型了所以我们可以把刚刚训练好的模型上传到Hugging Face上。第八步将微调后的模型保存为 GGUF 格式将微调后的模型上传到Hugging Face Hub之前我们先将它转换为 GGUF 格式。GGUF是一种高效的格式它支持多种量化方法如 4 位、8 位、16 位量化可以显著减小模型文件的大小便于存储和传输适合在资源受限的设备上运行模型例如在 Ollama 上部署时。量化后的模型在资源受限的设备上运行更快适合边缘设备或低功耗场景。转换的代码大家不用做任何更改这里还有一个需要大家关注就是设置HuggingFace的Access Token因为我们要直接调用HuggingFace的 API 把模型上传到我们自己的HuggingFace仓库这个 Token 就是用来做权限校验的。我们可以到HuggingFace的Settings - Access Tokens下创建一个自己的 Tokenhttps://huggingface.co/settings/tokens注意一定要配置为写权限不然后面没有权限创建仓库然后我们将这个 Token 复制到 Colab 左侧的Secret下创建一个名为HUGGINGFACE_TOKEN的Secret第九步将微调后的模型上传到 HuggingFace下面就是使用上面配置好的 Token调用 HuggingFace 的 API创建一个新的模型仓库然后把我们刚刚微调训练好的模型推送上去注意这里大家可以把仓库名称改为自己的「用户名模型名」然后大功告成我们去HuggingFace上查看一下https://huggingface.co/Conard/fortunetelling第十步使用 Ollama 运行 HuggingFace 模型Ollama支持直接从Hugging Face拉取模型格式如下ollama run hf.co/{username}/{repository}ollama run hf.co/Conard/fortunetelling下载完成后我们尝试运行一下我们也可在Chatbox、Anything LLM这些工具下使用最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】