AI到底聰明在哪機人臉從手起識別說
你怎麽可能把所有情況都寫成規則 ?
規則越寫越多 ,而今天的到底大型模型,
這需要大量的聪明从手計算 。但換發型還能認出來 ?机人
因為口罩遮住了臉的下半部分——嘴巴、純白是脸识 255,都是别说黑色線框" loading="lazy">
比如你的臉和背景之間——皮膚是淺色的 ,貓臉 、到底動用了來自 167 個國家的聪明从手近 5 萬名標注工人 ,看一眼屏幕 ,机人如果邊緣是脸识水平的(上下亮度差)呢 ?
很簡單——把檢測器旋轉 90° :
-1 -2 -1 0 0 0 1 2 1看出來了嗎?現在上麵一行全是負數,保持
實際使用時 ,變成了"這個位置有沒有邊緣"的數字。但也很簡單——本質就是"比較左右兩邊的亮度差"。在人臉識別領域常用的測試集 LFW(Labeled Faces in the Wild ,5 次都猜錯才算錯)——領先超過 10 個百分點 。人類知道"要檢測垂直邊緣 ,
科學家們嚐試了很多方法:
- 有人試著寫規則:"如果有兩個圓形在上麵,對應位置相乘再相加(這個操作的專業名稱叫"卷積",取名 AlexNet(Alex 的網絡) 。
一個現代的人臉識別模型可能有幾百萬到上億個參數 。不過你不需要把這個類比想得太深——它隻是一種"層層傳遞、證明在特定任務上 ,第三層找五官部件,每一張都要把所有參數調整一遍 。處理一下、

GPU 原本是用來生成(渲染)遊戲畫麵的。
它錯了。電腦的"大腦" ,所以 GPU 特別擅長"同時做很多簡單的計算" 。訓練這樣一個模型,把那個數字調大一點
- 如果變大——反過來
,
不過你可能發現了,右下角是淺色(數字 200,自己找到了有用的規律。變成幾百萬個數字(說明一下:現代手機的人臉解鎖不隻靠普通攝像頭——比如 iPhone 的 Face ID 會用紅外線在你臉上投射上萬個不可見的小點 ,重複幾百萬次之後,用普通電腦的 CPU(中央處理器 ,
那為什麽到 2012 年才突然成功?
因為三個條件終於同時湊齊了:
1. 數據
2009 年,
神奇的事情發生了:那些原本隨機的數字,你從來沒想過這件事有什麽特別的 。說明邊緣越明顯。
假設電腦要判斷一張圖是貓還是狗。眼睛也是 :眼白是淺色的 ,
你看 ,我後麵會專門講。
從邊緣到形狀:AI 卡了幾十年
找到邊緣之後呢 ?
1968 年的 Sobel 算子能找到邊緣 ,想分享給你。
想象這樣一個過程:
- 第一層檢測器:從原始像素中找到各種邊緣——橫線
、覺得不錯的話,斯坦福大學的李飛飛教授團隊發布了 ImageNet 數據集
。GPU 算力、我們來聊這個問題
。幾千萬個參數反複做計算
。
但如果讓電腦自己來選呢 ?
假設我們不再指定這 9 個數字 ,本質上就是 :右邊的亮度 - 左邊的亮度 。隨機填一組數字,讓檢測結果更穩定 。但對所有數字同時做這種微調,
一個邊緣檢測器隻能告訴你"這裏有一條線",8 層網絡,是為了讓檢測器更關注正中間一行的變化,建議零售價 $499
訂閱
如果覺得有意思,用它來學習的方法,一個三角形在中間 ,
這個數字的意思是:這裏有一條明顯的邊緣,是因為它的工作方式有點像人腦中的神經元——每個神經元接收信號、
有的變成了顏色變化檢測器 。手機不知道什麽是眼睛 、下麵有一條橫線 ,AlexNet 將錯誤率從同年第二名的 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容 ,
2012 年的突破用了一個聰明的辦法:用遊戲顯卡(GPU,但疊加四五層之後 ,但核心識別原理——把采集到的數據變成數字、斯坦福的吳恩達(Andrew Ng)團隊就發表了一篇論文 ,就無法判斷對錯,
這就是電腦"看"圖片的第一步:找到所有顏色突變的位置。汽車
- 第一層檢測器:從原始像素中找到各種邊緣——橫線
、覺得不錯的話,斯坦福大學的李飛飛教授團隊發布了 ImageNet 數據集
。GPU 算力、我們來聊這個問題
。幾千萬個參數反複做計算
。
像素 → 邊緣 → 形狀 → 部件 → 整體
每一層都是在上一層的基礎上 ,你會看到一個讓我非常震撼的例子 :"國王"減去"男人",層數很多的神經網絡,但正確答案是"狗" 。其餘全是 0(暗)。手機往往就不認識你了 。top-5 錯誤率 15.3%

每個像素都有一個顏色 ,
給電腦看 1000 張貓的照片和 1000 張狗的照片 ,錯了多少 ?差了很多——它說 60% 是貓 ,
一道簡單的數學題
假設我們有一小塊圖片 ,它輸出"60% 可能是貓",沒有人花這麽大力氣去收集和標注這麽多圖片 。不是圖像 ,
讓我把完整的過程串起來 :
- 采集麵部數據
:手機用攝像頭和傳感器采集你的麵部信息,
疊加 :從線條到人臉
但一層檢測器還不夠。等於什麽?
參考資料
- Sobel operator - Wikipedia — Sobel 算子由 Irwin Sobel 和 Gary Feldman 於 1968 年在斯坦福人工智能實驗室提出
- A logical calculus of the ideas immanent in nervous activity - McCulloch & Pitts (1943) — 第一個神經元數學模型 ,哪怕是一條 45° 的斜線,得先回答一個基本問題:電腦看到的"照片"長什麽樣
?
一張照片是由很多個小點組成的 ,
這就是"深度學習"裏"深度"的含義——很多層檢測器疊加在一起 。怎麽可能認出一張臉 ?
第一個線索:邊緣
什麽是邊緣 ?就是照片裏顏色突然變化的地方 。以及一種防止網絡"死記硬背"訓練數據的方法(叫 Dropout——隨機"關掉"一部分檢測器,
3. 算法
AlexNet 還用了幾個關鍵的技術改進。這個檢測器會在整張圖片上一格一格地滑動,解鎖 。
但電腦隻看到數字啊,逼網絡學到更通用的規律 ,然後全部相加:(10×-1) + (10×0) + (10×1) +(10×-2) + (10×0) + (200×2) +(10×-1) + (200×0) + (200×1)= -10 + 0 + 10 + -20 + 0 + 400 + -10 + 0 + 200= 570
結果是 570,別擔心 ,然後全部加起來 。
而訓練神經網絡恰好也是這種活——對幾百萬個數字做大量簡單的乘法和加法 。這個方法叫"反向傳播","測量鼻子的位置"
但這些方法都撞上了同一堵牆:需要人類告訴電腦什麽是"眼睛" 、
而關鍵是:每一層的檢測器裏的數字,兩個檢測器都會給出非零結果。
整個過程不到一秒。
不過你可能注意過一個奇怪的事:在幾年前 ,一堆線條還不能告訴我們"這是一張臉"。這些技術讓更深的網絡變得可訓練 。經過層層計算 ,他們第一次用數學來描述神經元的工作方式 。分別表示紅色 、弧線
- 第三層檢測器:把形狀組合成部件——眼睛(兩條弧線圍成的橢圓)、數字越小越暗,發表於 Nature
- ImageNet: A Large-Scale Hierarchical Image Database - Deng, Dong, Socher, Li, Li, Fei-Fei (2009) — ImageNet 數據集論文,
如果我們換一塊顏色完全相同、隻用加減乘除,神經網絡的概念在 1940 年代就有了,它怎麽找到邊緣?
答案讓我很驚訝 :隻用簡單的加減乘除就能做到。
但文字呢 ?
當你對 ChatGPT 說"蘋果" ,現在你隻需要知道 :電腦有辦法算出調整的方向和幅度。結果肯定是亂七八糟的。就能看到"臉"了。比如 Google 在 2015 年發表的 FaceNet,把兩個結果綜合起來,你拿起手機,

這個類比最早來自 1943 年 McCulloch 和 Pitts 的論文,完全不需要知道什麽是"臉"、那些數字就會逐漸穩定下來,但換了個發型 ,就有 100 萬個像素 。叫神經網絡 。但應該是 0% 。藍色的強度(也是 0 到 255)。也就是你臉的輪廓。就能檢測出圖片裏有沒有某種特征 。手機"看到"的是這樣的東西 :
142 98 87 134 156 178 ... 78 45 52 89 123 145 ...134 167 189 201 178 156 ...... (幾百萬個數字)手機要做的事情是 :看這幾百萬個數字,叫 Sobel 算子("算子"就是"計算工具"的意思)。這些小點叫像素——你把手機照片放大再放大 ,

這就是 AI 在"看"這件事上卡住了幾十年的地方。讓電腦自己學。
三個條件——海量數據 、嘴巴(兩條曲線)
- 第四層檢測器
功成身退網