我想要系统性的学习ai方面知识,比如构建本地大模型之类

该专题还在整理中。

先把路线说清楚:想系统性学 AI,并且最终能在自己机器上跑起来大模型,最有效的路径不是先啃论文,而是从“会用 API”到“会跑本地模型”,再到“会微调/量化”,最后补理论和工程化。这条线走下来,三到六个月能到能自己搭一套本地推理服务的程度,前提是别一上来就死磕反向传播推导。

为什么我建议你按这个顺序学

很多人一上来就买《深度学习》花书,看了三章卡在矩阵求导,然后放弃了。问题不在难,而在反馈太慢。AI 这个领域最大的优势是:你能在几小时内就让一个模型在你自己电脑上说话。这种正反馈才是撑你走下去的东西。

所以我的建议是分层推进:

  • 第一层:会用——调 API、写提示词、搭简单应用,理解 token、上下文、温度这些概念。
  • 第二层:会跑——在自己机器上部署开源模型,搞懂量化、显存、推理框架。
  • 第三层:会改——微调、LoRA、RAG、数据集构造。
  • 第四层:懂原理——Transformer 结构、注意力机制、训练流程。
  • 第五层:工程化——部署、并发、监控、成本控制。

下面逐层展开。

第一层:先把“用”这件事吃透

别小看这一层,很多人连 API 和本地模型的区别都说不清。你需要搞明白的核心概念:

  • Token:模型处理文本的最小单位,一个中文汉字大约 1~2 个 token,英文一个单词约 1.3 个 token。计费、上下文长度都按它算。
  • 上下文窗口:模型一次能“看见”多少 token。GPT-4o 是 128K,Claude 3.5 是 200K,很多开源模型是 8K 或 32K。
  • 温度(temperature):控制随机性,0 最确定,1 最发散。
  • 提示词工程:不是玄学,核心是给角色、给示例、给格式约束

这一层推荐直接用现成产品练手:

  • ChatGPT:综合能力最稳,适合入门。
  • Claude:长文本和代码理解强,写文档很舒服。
  • DeepSeek:国产里性价比极高,API 便宜,适合练手。
  • 智谱 GLM:国内合规、文档全,企业项目常用。

花一周时间,把这几家的 API 都调一遍,写个能读本地文档回答问题的小脚本。这一步做完,你对 AI 的体感就完全不一样了。

第二层:本地跑大模型,这才是你真正想学的

“构建本地大模型”这个说法其实有两种理解,得先分清:

理解 含义 难度 适合谁
本地部署开源模型 下载别人训练好的模型权重,在自己机器上推理 绝大多数人
从零训练模型 自己准备数据、写训练代码、跑预训练 极高 有算力有团队的机构

99% 的人说的“本地大模型”都是第一种。从零训练一个 7B 模型,光数据清洗和算力成本就是几十万起步,个人基本不现实。所以下面重点讲部署和微调。

硬件门槛先看清楚

模型规模 量化后显存需求 能跑的显卡
1.5B~3B 2~4 GB GTX 1650 / 核显勉强
7B~8B 5~8 GB(4bit 量化) RTX 3060 12G / 4060 Ti 16G
14B 10~12 GB RTX 4070 Ti Super / 3090
32B 20~24 GB RTX 3090 / 4090
70B 40 GB+ 双卡 3090 / A100

如果只有 Mac,M 系列芯片统一内存也能跑,M2 Pro 16G 能跑 7B 量化版,M3 Max 64G 能跑 70B 量化版,速度尚可。

推理框架怎么选

  • Ollama:最省心,一行命令下载并运行模型,适合新手。缺点是自定义能力弱。
  • LM Studio:图形界面,点点鼠标就能跑,还能看到实时 token 速度,非常适合体验。
  • llama.cpp:底层引擎,Ollama 和 LM Studio 都基于它。想深入必须看。
  • vLLM:生产级推理,吞吐量高,适合做服务,但配置复杂。
  • text-generation-webui:功能全,插件多,折腾党最爱。

我的建议:先用 Ollama 或 LM Studio 跑通,再用 llama.cpp 理解底层,最后上 vLLM 做服务

模型从哪下

  • Hugging Face:全球最大模型仓库,几乎所有的开源模型都在这。
  • ModelScope 魔搭:阿里出品,国内下载快,中文模型全。

推荐几个适合入门的模型:Qwen2.5 系列(中文强、尺寸全)、Llama 3.1 系列(生态好)、DeepSeek-V3/R1(推理能力强)、Gemma 2(Google 出品,小尺寸优秀)。

第三层:微调和 RAG,让模型真正为你所用

跑通模型只是开始,真正有价值的是让它懂你的数据。这里两条路:

  • RAG(检索增强生成):不改模型,外挂知识库,用户提问时先检索再喂给模型。适合知识频繁更新的场景,成本低,见效快。
  • 微调(Fine-tuning):用你的数据继续训练模型,改变它的“行为”和“风格”。适合固定任务、格式要求严格的场景。

RAG 的入门工具:

  • LangChain:生态最全,但抽象层多,初学容易晕。
  • LlamaIndex:专注 RAG,文档处理强。
  • RAGFlow:国产开源,带界面,上手快。
  • Dify:可视化编排,不写代码也能搭 RAG 应用。

微调的入门工具:

  • LLaMA-Factory:国产神器,支持几百种模型,WebUI 操作,LoRA/QLoRA 全支持。
  • Unsloth:训练速度提升 2 倍,显存省 70%,单卡微调 7B 模型很轻松。
  • QLoRA:4bit 量化微调,让 7B 模型在 8G 显存上也能训。

重点提醒:微调不是万能的。如果你只是想让模型回答公司文档里的问题,先做 RAG,别急着微调。微调适合改变输出风格、格式、语气,或者让模型学会某个特定任务。

第四层:补理论,但别从数学开始

到这一步你已经能跑能调了,再回头补理论会顺畅很多。推荐顺序:

  1. 3Blue1Brown 的神经网络系列:B 站有官方中文,可视化极强,先建立直觉。
  2. Andrej Karpathy 的 nanoGPT 和 “Let’s build GPT”:从零写一个 GPT,代码不到 300 行,看完你就懂 Transformer 了。
  3. 《Attention Is All You Need》:Transformer 原始论文,配合上面的视频看,不痛苦。
  4. 李沐的《动手学深度学习》https://zh.d2l.ai,免费,代码可跑,中文友好。
  5. Hugging Face 的 NLP Coursehttps://huggingface.co/learn/nlp-course,免费,实战导向。

数学部分(线代、概率、微积分)不用一开始就啃,遇到不懂的再回去查,效率高十倍。

第五层:工程化,决定你能不能做出真东西

模型跑起来容易,做成稳定服务难。这一层要学:

  • API 封装:FastAPI + vLLM,把模型包装成 HTTP 接口。
  • 并发和批处理:continuous batching、PagedAttention 这些概念要懂。
  • 向量数据库MilvusQdrantChroma,RAG 必备。
  • 监控和成本:token 消耗、响应延迟、GPU 利用率。
  • 容器化:Docker 部署,方便迁移。

一份可执行的学习计划

阶段 时间 目标 产出
第 1 周 7 天 调通 3 家 API,理解 token/上下文 一个命令行问答脚本
第 2~3 周 14 天 用 Ollama/LM Studio 跑通 7B 模型 本地聊天界面
第 4~5 周 14 天 学 llama.cpp,理解量化原理 手动转换一个 GGUF 模型
第 6~8 周 21 天 搭一个 RAG 应用 能读本地 PDF 问答的机器人
第 9~12 周 28 天 用 LLaMA-Factory 做一次 LoRA 微调 一个定制风格的模型
第 13 周起 持续 补理论 + 工程化 能部署成服务

几个容易踩的坑

  • 别一上来就买顶配显卡。先用现有设备跑小模型,确定自己真能坚持再升级。
  • 别迷信“大模型一定好”。7B 模型在特定任务上微调后,可能比 70B 通用模型更管用。
  • 别忽略数据质量。微调效果 80% 取决于数据,不是模型。
  • 别只看视频不动手。AI 是实践学科,看十小时不如跑一小时。
  • 别追新追到焦虑。每周都有新模型,选定一条线走完比什么都强。

相关问题

1. 没有显卡能学本地大模型吗?
能。用 Google Colab 免费 T4,或者租 AutoDL、阿里云按小时计费的 GPU,几块钱就能跑一次 7B 模型。

2. 学 AI 一定要会 Python 吗?
部署和调 API 会基础 Python 就够,微调和训练则需要更扎实的 Python 和 PyTorch 基础。

3. RAG 和微调到底选哪个?
知识更新频繁选 RAG,输出风格/格式固定选微调,两者也可以结合用。

4. 中文场景推荐哪个开源模型?
首选 Qwen2.5 系列和 DeepSeek 系列,中文能力、生态、社区支持都最好。

5. 学多久能做出能用的产品?
按上面的计划,认真执行三个月能做出 RAG 问答机器人,半年能做出带微调的定制服务。

内容由 AI 生成,产品信息请以官网为准。