AI到底聰明在哪機人臉從手起識別說
Alex Krizhevsky 正是到底用兩塊遊戲顯卡(NVIDIA GTX 580,

每個像素都有一個顏色,汽車
像素 → 邊緣 → 形狀 → 部件 → 整體
每一層都是机人在上一層的基礎上,分給大量網上工人完成的脸识平台) ,需要對幾百萬張圖片、别说歡迎關注我,到底加上"女人",聪明从手讓檢測器學會了隻靠眼睛和眉毛區域的机人特征來識別你。
有的脸识變成了紋理檢測器
。
邊緣勾勒出了圖片裏"有東西"的别说地方 。
2012 年 ,到底但對所有數字同時做這種微調,聪明从手
不過你可能發現了 ,机人
電腦沒有被告知"要檢測邊緣" 。脸识綠色、别说
怎麽用呢 ?把檢測器疊放到圖片上,這些技術讓更深的網絡變得可訓練。AlexNet 將錯誤率從同年第二名的 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容 ,
從邊緣到形狀:AI 卡了幾十年
找到邊緣之後呢 ?
1968 年的 Sobel 算子能找到邊緣,隻用加減乘除 ,就能檢測出圖片裏有沒有某種特征 。
核心突破 :讓電腦自己學
還記得前麵的 Sobel 算子嗎 ?
-1 0 1-2 0 2-1 0 1這 9 個數字是人類設計的。Hinton 和 Williams 發表在《Nature》(全球最權威的科學期刊之一)上的一篇論文奠定了這個方法的基礎。叫做反向傳播——1986 年由 Rumelhart 、
順便說一下這個檢測器的來曆 :Sobel 算子是 1968 年由 Irwin Sobel 和 Gary Feldman 在斯坦福人工智能實驗室的一次演講中提出的 ,檢測的東西連人類都說不清楚——但它們確實對區分貓和狗有用。
一堆數字 ,檢測器關注的主要是五官區域的特征——發型變了,鼻子(一個三角形輪廓)、打個比方 :所有人都在 74 分左右競爭,我後麵會專門講。數字越小越暗,是電腦自己從數據裏學出來的。它照樣能解鎖。5 次都猜錯才算錯)——領先超過 10 個百分點 。就要比較左右兩邊的亮度",我一直很好奇 AI 到底是怎麽工作的,而是有一套精巧的方法能算出每個數字該往大了調還是往小了調。
現在我用一個"檢測器"來掃描它 。如果邊緣是水平的(上下亮度差)呢 ?
很簡單——把檢測器旋轉 90° :
-1 -2 -1 0 0 0 1 2 1看出來了嗎?現在上麵一行全是負數,就是邊緣。
這個數字的意思是:這裏有一條明顯的邊緣 ,接近黑色),
但如果讓電腦自己來選呢?
假設我們不再指定這 9 個數字 ,
那些檢測器裏的數字,重複幾百萬次之後 ,數字越大,涵蓋 2 萬多個類別。沒有邊緣。你會看到一個讓我非常震撼的例子 :"國王"減去"男人",李飛飛團隊通過亞馬遜的眾包平台(一種把任務拆成小塊、戴上口罩,遊戲畫麵需要同時計算屏幕上幾百萬個像素的顏色,讓檢測結果更穩定。
一個新的問題
理解了 AI 怎麽"認人"之後 ,哪怕是一條 45° 的斜線,那些數字就會逐漸穩定下來,而顏色在電腦裏是用數字表示的 。背景可能是深色的,就是一組數字組成的小模板——把它疊到圖片上,

這就是 AI 在"看"這件事上卡住了幾十年的地方 。為了建成 ImageNet ,參數量更是以億計。才有了 2012 年的突破。
假設電腦要判斷一張圖是貓還是狗。但眼睛 、那可能是一張臉"
每次調整的幅度都很小(比如 0.001) ,下巴這些區域的麵部特征被口罩擋住了,表情——這些讓一張臉變得獨特的要素。
電腦眼中的照片
要理解手機怎麽"人臉識別" ,把兩個結果綜合起來,中間的灰色就是 1 到 254。一個管上下——就能找到圖片中任意方向的邊緣 。其中前 5 層做的就是我們前麵演示的操作——用檢測器在圖片上滑動 、
訓練:電腦怎麽知道該往哪調 ?
你可能還記得前麵留下的那個問題 :猜錯的時候,
如果我們換一塊顏色完全相同 、而是它從大量的對錯反饋中 ,它有 8 層。我產生了一個新的疑問:
AI 能"看"了——圖片在它眼裏是數字矩陣,這個檢測器會在整張圖片上一格一格地滑動,是從幾百萬張人臉照片中"學"出來的。到達一個"很少出錯"的狀態 。它通過層層檢測器從數字中提取特征 。就是一串能代表你長相特征的數字)
功成身退網