课程简介


       近年来,随着自然语言处理任务复杂度的不断提高,传统的机器学习算法已难以满足实际需求。在数据、算力和人工智能快速发展的背景下,深度学习已成为推动技术进步的核心力量。深度学习不仅在图像和语音处理等传统领域取得了重大突破,还在大语言模型领域展现出巨大的应用潜力。本课程将系统介绍深度学习及其在大语言模型中的应用,帮助学生全面理解和掌握这项前沿技术。

       通过学习深度学习和大语言模型的理论与应用,学生将能够有效应对不同复杂环境和任务,发展具有人脑模拟功能的智能模型。这不仅是数据挖掘和信息处理的核心技术,还已成为计算机学科研究生必备的技能。本课程通过理论讲解和实践操作,使学生不仅能够熟练掌握深度学习和大语言模型的先进理论知识,还能够将其应用于实际项目和新一代智能信息处理系统中。

课程大纲


        课程详细介绍了深度学习及其在大语言模型中的应用。课程结构包括三个部分:基础篇、进阶篇和应用篇。基础篇涵盖深度学习的基本概念和Transformer模型的基本原理,为学生构建坚实的理论基础。进阶篇深入探讨上下文学习、预训练与微调技术,及强化学习在模型对齐中的应用,提升学生对模型的优化能力。应用篇展示深度学习在聊天模型、视觉模型与生成模型的高级应用,并探讨大语言模型在蛋白质结构解析、代码生成和数学问题求解等领域的实际应用案例。具体内容包括:

基础篇

基础篇课程安排

名称

概要

术语表

参考文献

作业

1. 课程介绍

[课件1:Overview下载]

[课件2:ChatGLM下载]

[讲义1:课程介绍]

建议课时:3

回顾了人工智能的发展历史,并着重介绍了GLM系列模型。这些模型涵盖了语义理解、视频语义理解、图像生成、文本生成视频、图像生成视频、代码生成、智能代理(Agent)和多工具调用等多个领域。此外,讨论了大模型的思考与性能涌现,以及人工通用智能(AGI)的分级和未来的发展方向。

Artificial Intelligence

GPT

GLM

AGI

llama-3.1

gpt-4

glm-4

gemini

deepseek

claude

 

2. 深度学习基础

[课件1:DNN下载]

[课件2:CNN下载]

[课件3:RNN下载]

建议课时:3

介绍了深度前馈网络(Deep Feedforward Network)、损失函数、反向传播算法(Backpropagation Algorithm)、激活函数以及常见的模型架构。讨论了卷积神经网络(CNN)的卷积操作、池化操作,不同的CNN模型架构及其在二维(2D)和三维(3D)上的应用。此外,还介绍了循环神经网络(RNN)的基础结构、双向RNN、编码器-解码器架构、长期依赖(long-term dependencies)以及长短期记忆网络(LSTM)和门控循环单元(GRU)等高级模型。

DNN

CNN

RNN

 

 

3. Transformer基础

[课件:Transformer下载]

建议课时:3

回顾了深度神经网络(DNN)在自然语言处理(NLP)中的应用,重点介绍了Transformer结构。内容包括分词(tokenization)、词向量(word2vec)、注意力机制(Attention Mechanism)、Transformer内部各组件的作用、Transformer结构的演变。并具体介绍了以GPT为代表的仅解码器模型(Decoder-only models)、仅编码器模型(Encoder-only models)和编码器-解码器模型(Encoder-Decoder Models)。此外,还提及了GLM和GPT结构上的差异。

Tokenization

Attention

Transformer

Encoder-Decoder

 

HW1:GLM4-9B的基础代码复现

 

进阶篇

进阶篇课程安排

名称

概要

术语表

参考文献

作业

4. 语境学习与模型预训练

[课件1:In-Context Learning下载]

[课件2:Pretrain-LLM下载]

建议课时:3

首先介绍了什么是情境学习(in-context Learning),接着讨论了如何选择和设计示例,涵盖了单次提示(one-shot prompting)和少次提示(few-shot prompting),特别是引入了链式思维(chain of thought)思想。然后从数学角度解释了为什么情境学习在大规模语言模型(LLM)中是有效的,最后阐述了理解模型涌现能力(Emergent Abilities)的重要性。

此外,还介绍了训练大模型所面临的挑战,以及如何训练一个大模型的方法。具体内容包括数据并行、张量并行和参数并行等优化技术。说明了GLM-130B是如何训练出来的,以及LLAMA的训练过程,并强调了预训练时所采用的海量数据。

In-context Learning

Pre-training

CoT

Emergent Abilities

 

 

5. 后训练:监督式微调

[课件:Post-training-LLM下载]

建议课时:3

介绍了微调(finetuning)的概念及其必要性,即通过在预训练模型的基础上进一步训练,以提升模型在特定任务上的表现。大模型中的高效微调技术包括以LoRA(Low-Rank Adaptation)和QLoRA为代表的部分更新模型权重技术,以及以p-tuning为代表的优化提示(Optimizing Prompts)技术。此外,扩展微调(Scaling up Finetuning)在各种数据集和多任务下的应用,通过在不同任务和数据集上进行微调,增强了模型的指令遵循能力,使其更好地理解和执行各种指令,从而提高整体性能和适应性。

Finetuning

LoRA

P-tuning

 

 

6. 后训练:基于人类反馈的强化学习

[课件1:RL下载]

[课件2:RLHF下载]

[课件3:PPO/DPO下载]

建议课时:6

邀请了THU王宏宁教授,详细介绍了强化学习的基础,包括基本概念、分类、如何进行强化学习以及在强化学习中action和reward的设计。深入讲解了基于价值(value-based)和基于策略(policy-based,包括on-policy和off-policy)的强化学习方法,如Q-learning和A2C等。

课程还讨论了情境学习(In-context Learning)和监督微调(SFT)的缺点,并引入了基于人类反馈的强化学习(Reinforcement Learning from Human Feedback),以InstructGPT为例,详细讲解了如何获取人类反馈、以及如何使用PPO和DPO等强化学习算法进行训练的具体过程。最后,系统梳理了其他强化学习算法在大规模语言模型(LLM)中的应用,并介绍了OpenAI o1。

Reinforcement Learning

RLHF

PPO

DPO

 

 

7. 大语言模型的科学评估与对齐

[课件:Evaluation下载]

建议课时:3

邀请了CMU李磊教授,探讨大型语言模型(LLMs)是否能够公平地评估和改进模型生成的表现,分析这些模型是否真正掌握了特定知识,还是仅仅凭运气回答问题。课程内容包括展示评估LLMs在知识密集和语言生成任务上的科学方法,观察使用LLMs作为评估者时出现的自偏现象,并讨论后期训练方法,以更好地优化和调整LLMs,使其与人类判断和评价更加一致。本课程旨在通过科学手段,实现对LLMs的客观有效评估和优化。

Evaluation

Alignment

 

 

8. 智能体

[课件:AutoGLM下载]

建议课时:1.5

讲解了大模型自主智能体的相关研究,包括从 AgentBench 到 AutoGLM 的发展,介绍了如何通过 AgentBench 评估大模型作为智能体的能力,并提出了 AutoWebGLM——一种自主网页浏览智能体,旨在提升大模型在智能体应用中的表现。此外,探讨了 AndroidLab 作为一个在线环境中的交互平台与基准测试工具,用于评估智能体的表现,并介绍了 WebRL,通过自进化在线课程强化学习方法在在线环境中持续提升智能体的能力。

Agent

  HW2:LLM 的微调和 RAG

9. 大模型的安全与评估

 

建议课时:3

第一部分介绍了大模型安全的相关内容,涵盖了大模型面临的安全风险、Jailbreak 攻击、失败的大模型安全训练案例,并探讨了如何通过 SafetyBench 来评估大模型的安全性。第二部分则关注大模型的评估,区别于之前的科学评估专题,这一部分系统地介绍了各个方向当前的评估方式,分析了不同评估方式的优缺点,并讨论了Pre-和Post-Evaluation的应用。特别强调了多模态模型评估的方式及其面临的挑战。

Safety

Jailbreak attack

Pre-Evaluation

Post-Evaluation

LM-as-a-Judge

 

 

 

 

应用篇

应用篇课程安排

名称

概要

术语表

参考文献

作业

10. 项目提案

在2024年秋季的课程前半段,同学们基于 ChatGPT、ChatGLM等先进的语言模型和多模态技术,各小组选取不同的方向,经过几周的努力,完成了一系列创新而有趣的项目提案。这些项目涵盖了语言模型与推理、图像与视频处理、推荐系统优化、教育与医疗应用,以及商业与其他实际应用等多个领域,展示了先进技术在各个领域的广泛应用和巨大潜力。

推理

多模态模型

推荐系统

教育

科学

医疗

商业

应用

   

11. 基础与专用模型的协作与进化

建议课时:1

邀请了香港理工大学的杨红霞教授,概述了人工智能发展的历史、构建强大基础模型的洞见、超越OpenAI的创新路径、打破垄断的未来策略,并详细介绍了边缘GenAI的机遇、核心技术以及多模态理解和规划的挑战。还探讨了企业GenAI解决方案面临的基本挑战,并提出了一种新的GenAI范式,旨在以更低的成本实现前沿性能,并构建世界领先的企业GenAI基础设施。

Edge GenAI

Enterprise GenAI

Foundation Models

Specialized Models

 

 

12. 数据

建议课时:1

讨论了数据及其合成在大型语言模型训练中的重要性。定义了扩展法则,强调了模型大小、数据集大小和总计算量对模型最终能力的影响。讨论了大型语言模型训练所需的原始文本数据的特点,包括数据量、领域覆盖和数据质量。还涉及了数据来源、数据处理、数据对模型性能的影响、数据多样性的重要性以及开源数据集如Pile。此外,探讨了数据合成和增强的方法,包括数据增强和合成的基本概念,以及它们在数据准备、预训练和微调阶段的应用。最后,强调了数据创新和方法论创新在大型模型数据工程中的研究新方向。

Scaling Law

Data Synthesis

Data Augmentation

Open Source Data

 

 

13. 测试时计算

建议课时:1

探讨了在大型语言模型的测试时计算优化中存在的问题和解决方案。指出了上下文学习(In-Context Learning, ICL)和链式思考(Chain-of-Thought, CoT)方法的局限性,包括对示例选择和顺序的敏感性、推理过程缺乏验证以及CoT推理路径的单调性。提出了多种方法来解决这些问题,包括自我一致性、自我评估、自我检查、逻辑CoT(LogiCoT)、自我完善、自我验证和自我对比。这些方法旨在提高推理的多样性、验证推理过程的正确性,并增强模型的自我学习和自我改进能力。介绍了思维树(Tree of Thoughts, ToT)和蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)在LLMs中的应用,并总结了测试时计算的重要性和潜在的解决方案。

Test time compute

Self-Consistency

Self-Evaluation

Self-Check

Self-Refine

Self-Verification

Self-Contrast

TOT

MCTS

 

 

14. 语音模型

建议课时:1

探讨了更自然的人类计算机交互方式,包括基于LLM的聊天机器人、真实人类交互中的视觉、音频输入和语音输出,以及理解和表达情感的能力。详细讨论了SLM的定义、音频分析模式、口语聊天机器人、语音到语音任务的挑战、串行系统的基线问题、端到端语音模型的优势、语音标记化的关键特征、向量量化(VQ)的应用、预训练的挑战、利用文本训练语音LM的方法、轻量级对齐解决方案、GLM-4-Voice模型的特点、监督语音标记化、交错语音-文本预训练、预训练阶段、SFT阶段,以及GLM-4-Voice模型的一些实际应用案例。

GLM-4-Voice

Chatbots

ASR

TTS

Speech-to-Speech

 

 

15. week14

 

Manba

 

HW3:视觉LLM的理解和生成

16. week15       HW4:LLM高级推理
17. 项目报告 week16

在2024-2025年的AML课程中,同学们基于先进的LLM大语言模型和多模态技术,各小组选取不同的方向,经过整个学期的努力,完成了一系列创新而有深度的项目。这些项目涵盖了语言模型与推理、图像与视频处理、推荐系统优化、教育与医疗应用,以及商业与其他实际应用等多个领域,展示了理论研究和实际应用的强有力结合。

推理

多模态模型

推荐系统

教育

科学

医疗

商业

应用

   

特邀报告


特邀报告安排

日期与照片

报告人介绍

报告内容

2024/10/30

Lei Li

Carnegie Mellon University

Web:https://www.cs.cmu.edu/~leili/

Lei Li is an Assistant Professor in Language Technologies Institute at Carnegie Mellon University. His research focuses on machine translation, trustworthy LLMs, and AI drug discovery. He received Ph.D. from CMU School of Computer Science in 2011. He is a recipient of the ACL 2021 Best Paper Award, the CCF Young Elite Award in 2019, the CCF Distinguished Speaker in 2017, the Wu Wen-tsün AI prize in 2017, and the 2012 ACM SIGKDD dissertation award (runner-up), and is recognized as Notable Area Chair of the ICLR 2023. Previously, he was an associate professor (tenured) at UC Santa Barbara. Before that, he was the Founding Director of ByteDance AI Lab, a principal scientist at Baidu, and a postdoc researcher at UC Berkeley. He led and developed ByteDance’s machine translation system VolcTrans and AI writing system Xiaomingbot, and many of his algorithms have been deployed in products (Toutiao, Douyin, Tiktok, Lark), serving over one billion users.

Can large language models (LLMs) fairly evaluate and refine model generation performance? Does a large language model reliably know specific knowledge, or does it answer by luck? In this talk, we will present scientific methods for evaluating large language models for knowledge-intense and language-generation tasks. We observe self-bias when using LLMs as evaluators—an LLM favors its own output. We will further discuss post-training methods to refine and align LLMs better with human judgment and valuation.

2024/12/4

 

Hongxia Yang

The Hong Kong Polytechnic University (PolyU)

Hongxia Yang, with over 15 years of experience as an AI scientist, specializes in large-scale machine learning, data mining, and deep learning. Throughout her career, she has developed 10 significant algorithmic systems, improving the operations of various enterprises. Her research includes pre-trained models, big data analytics, and the practical deployment of large language model(LLM) systems in real settings. Prof. Yang has published more than 100 top-tier papers, amassed around 10K citations with an H-index of 46, and holds over 50 patents. She has received several awards, including the 2019 SAIL Award at the World Artificial Intelligence Conference and the 2020 National Science and Technology Progress Award, China’s top tech accolade. Named one of Forbes China’s Top 50 Women in Tech in 2022 and AI 2000 Most Influential Scholar Award in 2023-2024, Prof. Yang has held prominent roles at ByteDance US, Alibaba Group, Yahoo! Inc, and IBM T.J. Watson Research Center. She earned her PhD from Duke University and her B.S. from Nankai University.

Title: Collaboration and Evolution of Foundation and Specialized Models

Abstract: The prevailing computing resource monopoly significantly restricts AI development, confining participation in the pretraining stages of Large Language Models (LLMs) to a few researchers. We are currently developing an efficient continual pretraining infrastructure designed to produce high-quality small language models (SLM) and multimodal SLM, with a particular emphasis on enhancing reasoning capabilities. We also introduces a novel system that integrates hundreds of domain-specific models to construct a foundational model for Artificial General Intelligence (AGI) with minimal computational demand. By employing smaller, efficient models, leveraging top-ranked models across diverse domains through a robust ranking algorithm, and continuously optimizing the evolving foundation model, this approach seeks to democratize AI development. It shifts from the traditional 'model over data' or centralized LLM method to a 'model over models' or decentralized LLM strategy, aiming to reduce reliance on extensive computational resources and promote broader innovation and inclusivity in AI.

待更新

 

 

参考书目


[1] Yoshua Bengio, Ian J. Goodfellow, Aaron Courville. Deep Learning. 2016. [跳转阅读]

[2] Christopher M. Bishop. Pattern Recognition and Machine Learning. Springer, 2007. [跳转阅读]

[3] Daphne Koller, Nir Friedman. Probabilistic Graphical Models. MIT Press, 2009. [跳转阅读]

授课教授


Jie Tang Tsinghua University

课程助教


  • Jinhua Du 核心课程助教 Tsinghua University
  • Wendi Zheng Tsinghua University
  • Hanyu Lai Tsinghua University
  • Zhuoyi Yang Tsinghua University
  • Jiayan Teng Tsinghua University

课程设计


4次家庭小作业 (每次10%)

在AML2024中,唐杰老师依次为同学们介绍了DeepLearning、Transformer、Pretraining、Post-training、Self-learning、Chat Models、Visual Models、New LLMs 和 Applications等专题。四次小作业依次穿插在每两~三个专题后,包括LLM的基础代码复现、文本LLM的微调和RAG、视觉LLM的理解和生成、LLM的高级推理,技术栈可充分支撑完成AML助教Agent的设计和实现。具体参见跳转网页(AML2024课程作业文件)

 

大作业项目 (60%)

2-3名学生组成一个团队,应用机器学习解决一个实际问题。参照项目提案(大作业proposal说明)。我们希望看到:问题(是什么?),动机(为什么?),技术(如何解决?),结果及分析(你验证了上述声明吗?),以及结论。需要提交的材料包括:提案(第6周),期中报告(第9周),最终报告(第17周),以及实现代码(第17周)。所有报告应符合NIPS格式,并用英语撰写。提案演示(第11周),海报演示(第17周)。

 

其他 (额外10%~15%)

通过积极行为获得额外奖励 课堂互动、课外学习、参加研讨会等

助教在网络学堂提供了丰富的在线课堂互动讨论区:包括对课程内容、扩展学习材料等的讨论

助教在网络学堂提供了丰富的课外学习资料:包括书籍、PPT、论文等

助教会定期举办研讨会供同学们学习交流

具体参照Homework And Interaction

课程新闻


【2024-12-5】课程中期proposal展示网站搭建

【2024-12-4】Invited talk (杨红霞, 前阿里巴巴大语言模型(LLM)负责人、字节跳动豆包负责人,现任香港教授): Collaboration and Evolution of Foundation and Specialized Models,【地点】在线

【2024-11-20】课程大作业项目Proposal汇报:AML中期汇报

【2024-11-11】课程基本网站初步搭建:AML2024

【2024-11-08】课程配套算力平台初步搭建

【2024-10-30】Invited talk (Lei Li, CMU, former ByteDance): The Science of Evaluation and Alignment for Large Language Models,【地点】在线

【2024-10-22】课程大作业项目Proposal提交Openreview:THU 2024 FULL AML

【2024-10-20】课程大作业项目学生组队

【2024-10-10】斯坦福大学武森博士(在美创业)和智谱AI 顾晓韬博士和大家一起第一次Panel,【地点】智谱Ai