本文用比喻的方式解释CPU、GPU和NPU在AI计算中的区别:CPU擅长逻辑判断,GPU擅长大规模并行简单计算,NPU专为AI矩阵运算设计,低功耗适用于手机等终端。文章还指出AI训练的瓶颈常在显存带宽。
全世界最贵的算力,都在干同一件看似很笨的活。
不是 CPU 不行,是这个活它不擅长。
训练大模型、微调模型,拆到底就是一件事:把天文数字的乘法和加法,反反复复地算。没有多少复杂的判断,没有多少花活的逻辑,就是算,一直算。
而 CPU 和 GPU 的区别,恰好就卡在这儿。
1CPU 是一位教授
CPU 是电脑里的大脑。它的特点是人少,但个个是学霸:一般家用电脑就几个到几十个核心,每个核心都很聪明,什么题都会做——打开微信、刷新网页、解压文件,遇到"如果这样就那样"的逻辑判断,它反应飞快。
日常用电脑,90% 的活都是这种活:判断多、计算少,一步一步来。CPU 干这个,如鱼得水。
但问题来了。训练 AI 的作业长什么样?是这样的:把两个巨大的数字表格相乘,表格有多大?几百亿、上万亿个数字。而且是重复再重复,算完一遍再来一遍,重复几百万次。
这就不是"一道难题"了,而是"一亿道简单题"。教授再厉害,一道一道做,做到天荒地老。
2GPU 是一操场的学生
GPU 本来是画图的。画面上的每个像素怎么算颜色、算亮度,彼此不干扰,可以同时算——所以 GPU 从出生起就长成另一个样子:核心特别多,多的上千个;每个核心不太聪明,只会做简单的算术。
一个教授对一千个小学生。做奥数,教授赢;做一亿道乘法加法,教授一道一道做,一千个小学生一人发一道、同时开工——答案没有悬念。
AI 训练的活,恰好就是这种"彼此不干扰的简单算术"。数据一块一块的,你算你的表格,我算我的表格,最后拼一起。GPU 的人海战术,专业对口。
顺便解开一个老疑惑:为什么显卡能挖比特币?因为挖矿也是海量重复的简单计算——跟训练 AI 是同一类活。你看,知识它自己会串联。
3NPU 是专科门诊
那 NPU 又是什么?它的思路更极致:既然 AI 计算本质就是大量矩阵乘法,干脆把这套运算直接做成硬件电路,固化在芯片里 —— 不用复杂指令调度,一通电就专门干这件事。
GPU 像一支什么活都能上手的综合施工队,而 NPU 是只造一类建筑的预制件工厂:运算流程直接焊死在硬件上,速度更快,功耗也更低。
低功耗这点至关重要。模型训练大多在机房,供电充足,可以不计成本跑算力;但手机不一样。人像虚化、语音助手识别、相册自动分类,这些本地 AI 功能全都依赖电池供电,所以手机芯片里早就内置了 NPU。你所见的新款电视、汽车里,基本也都有它。
三兄弟放一张桌上,是这样的:
|
CPU |
GPU |
NPU |
|
|
人设 |
一位教授 |
一操场学生 |
专科门诊 |
|
核心数 |
几个到几十个 |
上千个 |
专用电路 |
|
擅长 |
逻辑判断 |
海量并行计算 |
AI 计算且省电 |
|
常在哪 |
电脑大脑 |
机房 / 显卡 |
手机 / 汽车 |
4还有个隐藏瓶颈
最后补一刀。训练 AI 的时候,最累的其实不一定是"算",而是"搬"——几十亿个数字要在存储和计算单元之间来回搬运,搬运通道的宽度(也就是显存带宽)经常是短板。
业内有句话:算得快不算快,喂得饱才算饱。这就是为什么高端 GPU 的显存贵得离谱,也是为什么 AI 时代显卡整卡比金子还紧俏——缺的从来不只是计算核心,还有喂饱这些核心的通道。
收个尾:CPU 是全能选手,逻辑判断样样行;GPU 是人海战术,专攻海量重复计算;NPU 是专科门诊,AI 的活干得又快又省电。训练大模型,就是要算亿万道简单题——所以讲台得让给操场。
· · ·
本篇为科普内容,比喻做了简化,核心数量等参数以具体产品为准。
原文始发于微信公众号(306Safe):训练AI为什么用GPU和NPU,和CPU又有啥区别?
- 左青龙
- 微信扫一扫
-
- 右白虎
- 微信扫一扫
-


评论