AI到底聰明在哪機人臉從手起識別說
像素 → 邊緣 → 形狀 → 部件 → 整體
每一層都是机人在上一層的基礎上,49000 名標注工人來自 167 個國家
所以當你拿手機對著自己的机人臉 ,也就是脸识你臉的輪廓。比如 ,别说上百層 ,到底訓練這樣一個模型,聪明从手加上"女人",机人就能檢測出圖片裏有沒有某種特征。脸识讓檢測結果更穩定。别说

這就是 AI 在"看"這件事上卡住了幾十年的地方。一個三角形在中間 ,
一個人的臉可以有無數種表情、然後全部相加:(10×-1) + (10×0) + (10×1) +(10×-2) + (10×0) + (200×2) +(10×-1) + (200×0) + (200×1)= -10 + 0 + 10 + -20 + 0 + 400 + -10 + 0 + 200= 570
結果是 570 ,它專門用來檢測垂直方向的邊緣 。層層疊加
但電腦隻看到數字啊 ,
讓我用一個簡化的例子來說明 。就能得到每個位置的"邊緣強度"和"邊緣方向" 。
比如下麵這個 5×5 的小圖:

在電腦裏,就是一組數字組成的小模板——把它疊到圖片上,就是"深度學習" 。這些技術讓更深的網絡變得可訓練。
解決方法是:疊加很多層 。第三層找五官部件,至今已經用了半個多世紀。下巴這些區域的麵部特征被口罩擋住了 ,
一堆數字 ,能識別的東西就越複雜 。需要對幾百萬張圖片、哪怕是一條 45° 的斜線,而顏色在電腦裏是用數字表示的。
一個新的問題
理解了 AI 怎麽"認人"之後,這個檢測器會在整張圖片上一格一格地滑動 ,
有的變成了邊緣檢測器(類似 Sobel 算子——電腦自己"發明"了類似的東西) 。你拿起手機 ,
核心突破:讓電腦自己學
還記得前麵的 Sobel 算子嗎?
-1 0 1-2 0 2-1 0 1這 9 個數字是人類設計的 。解鎖。幾千萬個參數反複做計算 。鼻梁這些區域的數字模式沒變 ,讓下次更可能猜對
怎麽調整?不是隨機亂調 ,結果肯定是亂七八糟的 。這些小點叫像素——你把手機照片放大再放大,
為什麽 2012 年才成功?
你可能會好奇 :如果"讓電腦自己學"這個想法這麽好 ,背景可能是深色的 ,重複幾百萬次之後 ,每張都貼好標簽——"這是貓"、是因為裏麵的某個數字該大一點
電腦會計算:如果某個檢測器裏的某個數字稍微變大一點,三角形、
假設電腦要判斷一張圖是貓還是狗 。一層一層往回追溯,反向傳播算法在 1986 年就發表了。
那些檢測器裏的數字 ,這可能要算好幾個月甚至幾年。第二層找形狀 ,從互聯網上收集的真實場景人臉照片 ,
這個困境持續了幾十年,為什麽沒有更早實現 ?
事實上,豎線、不過你不需要把這個類比想得太深——它隻是一種"層層傳遞、
一個現代的人臉識別模型可能有幾百萬到上億個參數 。

"標注好"的意思是 :每張圖片都有人告訴你"這是貓" 、第一層隻能看到線條 ,
如果我們換一塊顏色完全相同、最終這個數據集包含了超過 1400 萬張標注好的圖片,實際上在做這件事:
- 右邊像素的亮度 × 正數(加分)
- 左邊像素的亮度 × 負數(減分)
- 中間像素 × 0(不影響結果)
所以最終的結果 ,它隻是在做加減乘除:把像素變成邊緣 ,但邊緣隻是一堆線條 。

GPU 原本是用來生成(渲染)遊戲畫麵的 。五官、
想象這樣一個過程:
- 第一層檢測器 :從原始像素中找到各種邊緣——橫線 、
從邊緣到形狀:AI 卡了幾十年
找到邊緣之後呢 ?
1968 年的 Sobel 算子能找到邊緣,都不是人類設計的,也會同時在左右和上下兩個方向上產生亮度差 ,我後麵會專門講 。什麽是"眼睛",證明在特定任務上 ,
彩色照片稍微複雜一點 :每個像素需要三個數字,包含 5749 個人的 13000 多張照片)上達到了 99.63% 的準確率 。這就形成了一條邊緣,綜合判斷最終結果)。讓檢測器學會了隻靠眼睛和眉毛區域的特征來識別你。但疊加四五層之後 ,神經網絡研究的先驅 Geoffrey Hinton 的學生 Alex Krizhevsky 用這種"多層疊加"的方法做了一個圖像識別程序,那些數字就會逐漸穩定下來 ,它有 8 層。
2012 年的突破用了一個聰明的辦法 :用遊戲顯卡(GPU,它照樣能解鎖 。比如 Google 在 2015 年發表的 FaceNet,
電腦用隨機檢測器算出一個結果 ,
回到手機人臉識別

現在你知道手機是怎麽認出你的了 。排成 3×3:
10 10 1010 10 20010 200 200左上角是深色(數字 10 ,
科學家們嚐試了很多方法 :
- 有人試著寫規則 :"如果有兩個圓形在上麵
,

每天早上 ,我們來聊這個問題。把部件變成一組代表你這張臉的數字,覺得不錯的話,這個係列就是我的探索筆記 ,取名 AlexNet(Alex 的網絡)。表情——這些讓一張臉變得獨特的要素。無數種角度 、就能看到一個個小方塊 ,8 層網絡,但換了個發型,你會看到一個讓我非常震撼的例子 :"國王"減去"男人",它怎麽找到邊緣?
答案讓我很驚訝:隻用簡單的加減乘除就能做到 。在人臉識別領域常用的測試集 LFW(Labeled Faces in the Wild ,
為什麽這個檢測器能工作?
你可能會好奇 :
-1, 0, 1, -2, 0, 2, -1, 0, 1這幾個數字是怎麽來的 ?為什麽這樣排列就能檢測邊緣 ?讓我解釋一下它的邏輯。最終的錯誤會變大還是變小
- 有人試著寫規則 :"如果有兩個圓形在上麵
,
功成身退網