About

关于本书

《从神经元到大模型》是配套 C++ 深度学习项目的交互式中文电子书,由 chenxuan 编写与维护。 如果你在别处看到本书内容,请优先核对是否保留了作者署名和原始链接。

最后内容更新:

这本书从哪里来

这本书一开始并不是计划中的教材。我只是想把深度学习真正弄明白:一个看似简单的神经元,怎样经过前向传播、误差、反向传播和一次次参数更新, 一路走到今天风靡全球的大模型。

为了不把关键步骤藏在框架的一行调用后面,我用 C++ 从零写了一遍最小实现。代码写下去,问题也跟着一个个冒出来: 梯度为什么能指路?注意力为什么有效?一个小模型怎样变成能够生成文本的语言模型?我把每次卡住、查证、想通的过程逐渐整理下来, 最后它们汇成了你现在看到的这本书。

写给正在追问“为什么”的你

我希望它不只给你一串结论,还让你亲眼看见:从一个神经元开始,每一步究竟在做什么,又怎样一层层搭成更大的模型。 正如《从沙子到 Mythos》里那条从硅到智能的长路一样, 今天的大模型也不是凭空出现的,而是无数人不断追问、动手和累积的结果。愿你也成为未来那片群星里,愿意发出自己光的一颗星。

原始地址

联系方式

如果你发现内容错误、链接失效,或希望就本书内容联系作者,可以发邮件到 chenxuanweb@qq.com

内容许可

除非页面或文件另有说明,本电子书文字、图解、交互说明与章节内容采用 Creative Commons BY-NC-SA 4.0 授权:可以学习、分享、引用和改编,但必须遵守以下条件。

要求说明
署名必须标明作者 chenxuan,并保留本书在线地址或 GitHub 仓库链接。
非商业未经作者许可,不得将本书内容用于售卖课程、付费专栏、商业出版、商业培训或其他商业分发。
相同方式共享如果你改编、翻译或再发布本书内容,衍生内容也应采用同样或兼容的非商业署名共享协议。
保留说明不得删除作者、来源、许可说明,不得伪装成自己的原创作品。

简短版本:欢迎学习和非商业分享,但请署名、贴原始链接,不要去署名搬运或商用倒卖。

代码与第三方依赖

仓库根目录已提供 MIT License: 本项目自写的 C++ 源码、示例程序、构建脚本等代码部分按 MIT 协议开源。 这意味着你可以自由使用、复制、修改、合并、发布和分发代码,但需要保留原始版权声明和 MIT 许可文本。

注意:电子书内容和代码授权分开看。本书正文、图解、交互说明等内容按上面的 CC BY-NC-SA 4.0 授权;代码按仓库根目录 LICENSEMIT License 授权。 src/third_party/ 下的第三方库继续遵循它们各自目录里的许可证文件。

引用建议

如果你在文章、课程、笔记或项目里引用本书,建议写成:

chenxuan,《从神经元到大模型》, https://deeplearning.011203.xyz/

谢谢尊重原创

写一本能让初学者真正读懂的书,需要持续试错、重写和验证。保留署名和链接,是对这份工作的基本尊重。

回到书本封面