Skip to the content.

写在前面

AI的知识庞大且复杂,同时发展迅速,若只是作为基本工具使用,大语言模型的帮助以及丰富的生态将入门门槛打至骨折,但前沿运用与研究仍需要大量沉淀,请务必想清楚为什么要学AI。如果你只是想找到一份更好的工作,我们认为在这个AI的时代,反而是对AI做各种支持的前后客户端,PM等机会更多,更容易找到一份理想的工作,性价比更高。AI组的研究方向是底层算法、模型、训练方法等AI基建。当下,本科生也能发表AI论文,但不代表不需要基础与领域的深造。其次,并不是只有AI组才能做AI,我们更关注底层算法。请务必思考清楚为什么要学AI为什么要报名AI组,否则你很有可能被刷掉。在这个最火的领域,如果你真心热爱并且决心钻研底层算法,你需要和全世界最顶尖的人才与资源竞争,请做好心理准备。

AI的细分路线非常多,我们非常建议你在了解深度学习的基本知识之后多在细分方向进行一些了解和探索。本指南会按照通用知识-细分方向及前沿来书写,你只需要了解你基础知识+感兴趣的方向(如果学有余力)即可。

其次,现在大语言模型和AI工具非常发达,我们强烈推荐你使用LLM获取信息来提高信息获取的效率,使用AI编程工具来辅助编程。但请注意,不要过度依赖AI工具,你至少需要理解AI生成的东西并有判断正误的能力。下面是一些推荐的LLM和AI工具:deepseek, copilot, claude, kimi, glm, codex gemini, grok, chatgpt。以上工具都是免费的或者至少有免费的功能,当然也可以付费解锁更强大的伙伴。

基础知识

Linux / Git

操作系统选择

强烈不建议在 Windows 系统下进行 AI 相关代码的运行

Linux 和 Git 速成

Linux Git 的基本知识可以参考 @SukunaIntro to CS(https://sukunahust.lanzn.com/iThKK1pqq9gj)的第三部分 3.1~3.3 和 4.3,这些内容能帮你快速掌握 Linux 和 Git 的基本使用方法。随后,建议在实际操作中加以应用,并在遇到问题时查阅相关文档或询问 GPT 。

Python

基础知识

  1. 环境搭建:安装 Python(推荐 3.9 或以上版本,强烈不推荐最新版)、Anaconda/miniconda、配置 IDE(如 PyCharm 或 VS Code,强烈推荐 VSCode)(如果要用PyCharm可以在JetBrains中注册学生账号使用)

  2. 基本语法:变量、数据类型(整数、浮点数、字符串、列表、字典等)、运算符。

3) 控制流程:条件语句(if-else)、循环(for、while)。

4) 函数:定义函数、参数传递、lambda 函数。

  1. 模块与包:导入标准库(如 math、random),理解 pip 安装第三方库

进阶内容

  1. 面向对象编程:类、对象、继承、封装。

  2. 文件操作:读取和写入文本文件、处理 CSV 文件。

3) 数据分析基础:NumPy(数组操作)、Pandas(数据框处理)。

4) 常用库:熟悉 os、sys、time 等实用模块。

AI相关Python 技能

  1. 科学计算与可视化:Matplotlib 和 Seaborn(数据可视化)

  2. 机器学习基础:Scikit-learn(简单模型训练,如线性回归、分类)

  3. 深度学习入门:TensorFlow 或 PyTorch 基础(安装、简单神经网络)

  4. 数据预处理:清洗数据、处理缺失值、特征工程

建议任务

推荐课程与教程

  1. 廖雪峰的网站

在网站上大部分python语法知识均有涵盖,大概学习到面向对象编程,最好网上找一些习题帮助自己巩固

一门非常基础的 AI 入门课,让人眼前一亮的是 12 个设计精巧的编程作业,都会用学到的 AI 知识去实现一个简易的游戏 AI,比如用强化学习训练一个 Nim 游戏的 AI,用 alpha-beta 剪枝去扫雷等等,可以加强理解AI中python语言的作用。

这个课程较难,主要是在介绍python的高级语言特质与抽象,强调掌握用程序来解决实际问题,而不关注底层的硬件细节

python学习是为了AI程序编写服务的,应该需要在阅读与理解经典架构的基础上,通过代码复现的方式加强对python语言的理解与运用

Pytorch or Tensorflow

建议初学者先学习 pytorch,学术界一般都使用 pytorch,工业界有部分使用 TensorFlow

一个比较详细的 pytorch 参考教程 https://tingsongyu.github.io/PyTorch-Tutorial-2nd/

(如果你对自己的英语能力非常有信心,你也可以直接啃文档Pytorch文档

常用且重要的函数与类:

服务器 / ssh

在你尝试简单的模型(如手写数字分类)时,你可以简单地使用 CPU 来完成模型的训练和推理。但当你试图训练或推理更大的模型,或使用更大的数据集时,GPU 可以大大增加模型训练和推理的速度(原因之一是 GPU 能同时计算很多向量操作)。

在 AI 领域,目前主流的 GPU 是 NVIDIA(英伟达) 的,如果你的电脑有英伟达的独显,那么你可以在 Pytorch 中通过 CUDA 库来调用对应 GPU(注意:需要在安装 pytorch 时安装 cuda 版本的 pytorch,而不是 cpu 版本的 pytorch

如果你的电脑没有英伟达的独显,那么你可能就需要使用第三方的 GPU 服务器租赁服务,在 autodl(https://www.autodl.com/)上可以按小时租赁 GPU 服务器,比较适合练习,可以用相对合理的价格租到个人一般不会购买的 GPU,例如 RTX 4090 的价格为 2.08/时。需要注意的是,在使用完毕服务器后需要及时关闭,否则会不断扣费,直到耗尽账户中的余额因此,不建议一次性在 autodl 中充值很多钱,建议一次充值 5~10 元,避免大量损失。

租赁的服务器需要使用 ssh 连接,非常推荐你使用 VSCode,利用 Remote-SSH 插件可以获得和本地 GPU 几乎一致的代码编写/运行体验。

关于 autodl 的具体使用,可以参考 autodl 的官方文档,提供了非常详细的使用方法,甚至包含了视频教程:https://www.autodl.com/docs/

数学知识

数学知识是人工智能与AI的基础,优秀的数学能力可以让你在科研的道路上更加顺利。但同时,深度学习也不一定需要非常强大的数学知识,通常一知半解也足够,但我们认为多了解和掌握数学知识仍是必要的。该部分加粗的部分为重点知识,推荐必看,加*号的知识为部分领域用到或者已经过时的知识,推荐遇到了再看同时,推荐的课程和教材适合有时间的时候系统学习,我们建议直接从知识要点入手而不是系统的学习数学知识,系统学习效率过低,而且很多知识可能很久都用不到。

线性代数

线性代数是人工智能的核心数学基础之一,它为神经网络、机器学习算法和数据处理提供了必要的理论工具。在AI领域,线性代数的应用无处不在,从简单的向量运算到复杂的矩阵分解,都是构建和理解AI模型的基石。

知识要点:

不错的教材或课程

概率论

知识要点:

不错的教材或课程

基础算法&模型

基础算法和模型是人工智能的基座,我们会提供知识要点和一些学习资料。由于AI的知识非常庞杂,我们建议你在学习资料里找对应知识要点的部分进行观看和学习来获得最高效率。同时知识要点中涉及的知识点也是面试和熬测的重要内容。

知识要点

基础算法:

神经网络模型:

不错的教材or课程

英语与文献阅读(进阶)

对于AI来说,英语是国际通行语言,而且很多概念都是英文的,没有翻译或者翻译过来很奇怪。学习人工智能不可避免的要阅读英文文献和英文文档,进行英语写作和交流。我们不推荐没有任何经验的小白直接啃英文原文,即使你英语很好,大量的专有名词也会劝退。我们建议先从基础和经典论文的讲解看起, 比如李沐老师的论文讲解合集B站UP主deep_thoughts的论文讲解等。推荐从经典的论文GANTransformer看起。对于经典的论文,一定要弄懂其中的每段话和每个公式,同时需要注意积累专有概念的表达。

当你啃完一些经典论文之后,论文讲解视频已经不能满足你的知识获取了,这时候可以搜索相关领域或者子方向的论文进行阅读。计算机的绝大多数论文都在arxiv上进行发布,这个网站免费且资源丰富。其余一些论文可能会发在各种期刊或者会议上,推荐使用google scholar进行检索。同时推荐使用zotero进行论文的分类管理。需要查找对应方向的SOTA工作和bencmark可以访问paper with code,也推荐使用paper with code和github查找对论文的复现代码并动手进行复现。

当你已经在AI领域耕耘了一段时间,论文写作是不可避免的问题,当然论文写作更多的需要老师和师兄的指导,每个实验室的标准和习惯略有不同,这里仅做粗浅的介绍。推荐使用latex和overleaf进行论文写作。论文写作教程可以查看 顶会论文写作建议

细分方向

CV(Computer Vision)

计算机视觉(Computer Vision, CV)旨在赋予机器模拟人类视觉系统的能力,使其能够从图像或视频中提取高层次语义信息。随着深度学习技术的突破,神经网络已成为CV领域的核心方法。CV 是一个极其广大的范围,含有几十种任务,我们可以进行如下的分类:

CV研究按层次感知可分为下面三个方向:

CV在互联网中的教程是AI领域中最多的一个,入门推荐CS231n,如果你想投入这个方向,我们希望你对于最基本的一些CNN网络有所了解,例如AlexNet,GoogleNet,VGG,UNet等。如果这些都不够体现你的才华,你可以在中层次任务中选取任意一个任务深入了解这个任务中的经典网络结构和设计理念,例如语义分割中的 UNet,SegNet,Mask2Former 等;目标检测中的 YOLO,RCNN,DETR系列网络。如果这仍装不下你的才华,你可以进一步了解高层次认知的任务和网络,例如Diffusion,BEiT,DeiT等等

NLP(Natural Language Processing)

自然语言处理(Natural Language Processing, NLP)是人工智能的一个重要分支,致力于让计算机理解、解释和生成人类语言。NLP技术使计算机能够处理、分析和生成自然语言文本,实现人机交互的自然化。随着深度学习和大模型的发展,NLP领域取得了革命性的突破。

NLP研究可以按照任务复杂度和语义理解层次分为以下几个方向:

NLP入门推荐学习Stanford的CS224n课程,以及Jurafsky和Martin的《Speech and Language Processing》教材。如果你想投入这个方向,建议先掌握基础的语言模型概念,如n-gram、RNN、LSTM等,然后深入学习Transformer架构及其变体,这是当前NLP领域的核心技术。

对于进阶学习,可以选择特定任务深入研究,如机器翻译中的注意力机制、文本生成中的解码策略、对话系统中的上下文建模等。如果你对大模型感兴趣,可以学习预训练-微调范式、提示工程(Prompt Engineering)、RLHF(人类反馈的强化学习)等技术。其他推荐的课程有人大高瓴大模型综述。此外你也可以了解一下RAG,CoT等技术以及Difylangchain等大模型应用工具。

NLP是一个发展迅速且应用广泛的领域,从搜索引擎、智能助手到内容创作、自动翻译,都有NLP技术的身影。如果你对语言和计算机的交互充满热情,NLP将是一个既有挑战性又充满机遇的研究方向!

Speech and Audio

语音的任务大致分为两大类,第一类是声音的理解,第二类是声音的重建。这延申出了ASR(语音识别)和TTS(语音合成)两个主要的大方向。此外,也有很多其他方向比如说SE(Speech Enhancement),SVS(Singing Voice Synthesis)等等。语音是一项非常古老的技术,甚至远早于互联网和AI。语音的教程相对较少,推荐李宏毅老师的视频,和CMU WAVLab的视频。比较经典的论文有:HiFi-GANVITSwav2vec,语音大模型方向模型:VALL-ETortoise-TTSwhisperHuBERTGPT-SoVITS,建议对语音感兴趣的同学从一些常用的语音处理库和语音基础概念开始学习,比如常用库librosa, soundfile, kaldi, espnet等,常用的概念有MFCC (梅尔频率倒谱系数)、F0(基频)、频谱(Spectrogram)、谐波(Harmonics)、声码器(Vocoder)等。你也可以从兴趣出发,比如说Vocaloid,GSV等技术开始学起。此外,B站UP主皮皮虾勇闯天涯的视频是语音入门和语音总体概述非常不错的视频。语音是一个相对没那么卷但是也快要卷到头的方向,如果你热爱语音技术,相信你可以获得很大的收获!

3D Vision

3D视觉(3D Vision)关注从二维图像、点云、深度图、网格等数据中恢复和理解三维场景,是CV中从“看见世界”走向“理解空间”的关键方向。它涵盖了三维重建、三维检测、三维语义理解、动态场景建模等多个任务,并与机器人、AR/VR、自动驾驶、虚拟资产生成高度相关。

从任务上看,3D视觉通常可以分为:

常见入门资料和网站推荐:

具身智能(Embodied AI)旨在通过物理或虚拟实体与环境的动态交互,实现智能系统的自主感知、决策与行动闭环,是AI领域中处于最上层的任务。其核心在于将智能体(Agent)与本体(Embodied Body)深度融合。具身智能 = 本体(物理载体) + 智能体(感知-决策-执行闭环),通过与环境的实时交互实现任务目标,其发展历程可划分为:

与AI其他领域(统称为离身智能(Disembodied AI))的区别在于:离身智能依赖旁观式数据(如ChatGPT、图像分类模型),缺乏物理交互能力,而具身智能:通过主动交互学习(如机器人抓取、视觉导航),需解决物理仿真、多模态对齐等挑战。分为三个模块:本体(物理平台+仿真平台),感知(目标检测,语义分割,视觉-语音导航),交互与学习(规划(world model),学习(例如PPO学习算法))

近两年,具身智能中一个非常关键的趋势是VLA(Vision-Language-Action)范式:将视觉、语言和动作统一到一个大模型中,让智能体能够根据图像观察和自然语言指令直接产出控制动作。

另一个值得关注的方向是WAM(World Action Model,或更广义的world model/action model):它并不只输出最终动作,而是希望模型同时建模“世界如何变化”和“某个动作会带来什么结果”

投身这个方向需要你对AI各个领域都有一定了解,包括但不限于CV,多模态,RL等,其中CV与多模态的知识用于具身智能中对外界环境的感知,RL等知识用于与环境的交互,规划和学习。这个领域上手难度高且网上缺乏系统的学习资源,可以参考这个github repo进行学习:https://github.com/tianxingchen/Embodied-AI-Guide

RL(Reinforce Learning)

RL是非监督学习的代表,根据模型与环境的实时交互获取奖励进行自我迭代更新。

在面对人类难以完全覆盖的数据集上,RL具有广泛的运用前景,如路径规划、机器人、大模型的数据。

前置知识:

入门可以将Gymnasium库的Atari的若干小游戏跑一跑,尝试DQN、PG、TD3、PPO等各种基础模型。一些教学:Hands-on-RL(SJTU)David Silver(UCL) 李宏毅(NTU台大) 周博磊(UCLA)

需要注意的是,RL的算法现在基本上都是用PPO,实际效果差异多在奖励的设计上,所以同学们在学习搭建模型时如果遇到不收敛的情况,也有可能是你的奖励设计不合理。

前沿方向:RL paper,具身智能,自监督学习,RLHF,多智能体等等。

AI4Sci(AI for Science)

AI for Science (AI4Sci) 是人工智能与各科学领域交叉融合的前沿方向,旨在利用AI技术加速科学发现、优化实验设计和提升理论建模能力。随着深度学习和大模型的发展,AI已从传统的数据分析工具转变为科学研究的核心驱动力,能够处理高维复杂数据并发现人类难以察觉的模式。

AI4Sci研究可按应用领域分为以下几个主要方向:

AI4Sci领域要求交叉学科背景,既需要扎实的AI技术基础,也需要对特定科学领域有深入理解。入门推荐学习资源包括Stanford的CS-X系列课程(如CS279: Computational Biology)、MIT的6.874(Computational Systems Biology)以及各大顶会(NeurIPS、ICLR、ICML)中的AI4Science workshop。

核心技术包括图神经网络(GNN)、几何深度学习、物理信息神经网络(PINN)、可解释AI和自动实验设计等。经典论文如AlphaFold、E3NN(等变神经网络)、SE(3)-Transformer等值得深入研究。

AI4Sci是一个快速发展且影响深远的方向,如果你对科学有浓厚兴趣并具备编程能力,这个领域将为你提供将AI技术应用于解决重大科学挑战的机会,有望在药物发现、气候变化、新材料设计等领域产生突破性进展。

P.S.组内成员研究方向有限,可能有些方向没涉及到,并且NLP、AI4Sci方向仅供参考。

其他资源推荐

相关网站

网站 简介
UESTC AI 社指南 UESTC AI 社整理的 AI 学习指南,部分情况下需要登录飞书访问
arXiv 计算机科学、人工智能、数学等领域的论文预印本平台
Hugging Face Trending Papers AI 热门论文与代码,原 paperswithcode.com 目前跳转至此
Kaggle 数据科学与机器学习竞赛、数据集、Notebook 和课程平台
GitHub 开源代码、AI 项目与学习资料
Hugging Face 模型、数据集、Spaces、论文与开源 AI 社区
魔搭社区 ModelScope AI 模型、数据集、应用与中文开源模型社区
AutoDL GPU 云算力与深度学习训练环境
fast.ai 面向实践的免费深度学习课程与开源工具

相关博主

博主 平台 主页
Andrej Karpathy YouTube Andrej Karpathy
3Blue1Brown YouTube 3Blue1Brown
跟李沐学 AI Bilibili 李沐
deep_thoughts Bilibili deep_thoughts
五道口纳什 Bilibili 五道口纳什
ZOMI 酱 Bilibili ZOMI 酱
AI老兵文哲 Bilibili AI老兵文哲

相关公众号

公众号 微信号 / 搜索名 主要方向 相关入口
Datawhale Datawhale AI 系统学习、开源教程、组队学习、LLM 实战 Datawhale 官网
AI前线 ai-front 大模型、AI 工程实践、技术案例 InfoQ 公众号矩阵
机器之心 almosthuman2014 AI 前沿、论文解读、机器学习、大模型 机器之心
量子位 QbitAI 大模型、AI 产品、科研与产业动态 量子位
CVer CVerNews 计算机视觉、深度学习、自动驾驶、论文 微信搜索 CVerNews
极市平台 extrememart CV 算法、论文、竞赛与工程实践 极市平台
PaperWeekly paperweekly AI 论文推荐、解读与学术交流 微信搜索 paperweekly
AI科技评论 aitechtalk AI 学术前沿、论文、科研与产业 微信搜索 aitechtalk
AINLP nlpjob NLP、LLM、机器学习、推荐系统 微信搜索 nlpjob
深度学习自然语言处理 zenRRan 深度学习、NLP、大模型与论文解读 微信搜索 zenRRan