YouTube 上新发布了一段 3 小时 31 分钟的视频:
"深入解析 ChatGPT 等大语言模型"
本视频面向普通观众,深入探讨驱动 ChatGPT 及相关产品的大语言模型(LLM)AI 技术。内容涵盖模型开发的完整训练流程、如何理解其“心理”的思维模型,以及如何在实际应用中最佳地使用它们。
我们涵盖了所有主要阶段:
- 预训练:数据、分词、Transformer 神经网络的输入/输出与内部机制、推理、GPT-2 训练示例、Llama 3.1 基础推理示例
- 监督微调:对话数据、“LLM 心理学”:幻觉、工具使用、知识/工作记忆、自我认知、模型需要 token 来思考、拼写、参差不齐的智能
- 强化学习:熟能生巧、DeepSeek-R1、AlphaGo、RLHF。
我将此视频设计为我的“普通观众”系列,我相信即使没有技术背景的人也能理解。它将让你直观理解 ChatGPT 等大语言模型的完整训练流程,过程中包含许多示例,并提供一些关于当前能力、现状及未来发展的思考方式。
(另外,我大约一年前已经有一个“LLM 入门”视频,但那只是某次演讲的重新录制,所以我想重新制作一个更全面的版本。这两个视频可以结合观看,因为那个演讲深入探讨了其他主题,例如 LLM 操作系统和 LLM 安全)
希望它有趣且有用!
