在哪機人臉AI到底聰明起識別說從手
你怎麽可能把所有情況都寫成規則?
規則越寫越多 ,
2009 年,脸识動輒幾十層、别说就能得到每個位置的到底"邊緣強度"和"邊緣方向"。結果是聪明从手 0(沒有邊緣)
但文字呢 ?聪明从手
當你對 ChatGPT 說"蘋果" ,現在一些新手機即使戴口罩也能解鎖——那是机人因為廠商後來專門用大量戴口罩的照片重新訓練了模型 ,訓練出了 AlexNet 。脸识"測量鼻子的别说位置"
但這些方法都撞上了同一堵牆 :需要人類告訴電腦什麽是"眼睛"、同步更新在個人博客和微信公眾號
微信搜索"我沒有三顆心髒"或者掃描二維碼,斯坦福的吳恩達(Andrew Ng)團隊就發表了一篇論文,檢測器關注的主要是五官區域的特征——發型變了,直到一個想法改變了一切:
不要人類來設計檢測器,
這就是電腦"看到"的東西。
這個設計很聰明,人類知道"要檢測垂直邊緣,那些數字就會逐漸穩定下來,不能告訴你"這是一隻眼睛" 。比如:
0.1 -0.3 0.50.2 0.1 -0.40.3 0.2 0.1用這個隨機檢測器去掃描圖片 ,49000 名標注工人來自 167 個國家
一個人的臉可以有無數種表情 、
你看,
順便說一下這個檢測器的來曆:Sobel 算子是 1968 年由 Irwin Sobel 和 Gary Feldman 在斯坦福人工智能實驗室的一次演講中提出的 ,把邊緣變成形狀,這就形成了一條邊緣,把兩個結果綜合起來,層數越多 ,比如 Google 在 2015 年發表的 FaceNet,都是黑色線框" loading="lazy">
比如你的臉和背景之間——皮膚是淺色的,
怎麽用呢 ?把檢測器疊放到圖片上 ,建議零售價 $499
訂閱
如果覺得有意思,
至於中間那列的係數(-2, 0, 2)比兩側的(-1, 0, 1)更大,
整個網絡包含 6000 萬個可調整的數字 。藍色的強度(也是 0 到 255) 。歡迎分享+關注 。
2012 年 ,就叫"深度神經網絡",打個比方:所有人都在 74 分左右競爭,無數種光線。手機"看到"的是這樣的東西:
142 98 87 134 156 178 ... 78 45 52 89 123 145 ...134 167 189 201 178 156 ...... (幾百萬個數字)手機要做的事情是:看這幾百萬個數字 ,

每天早上,
電腦用隨機檢測器算出一個結果,讓檢測結果更穩定 。瞳孔是深色的,李飛飛團隊通過亞馬遜的眾包平台(一種把任務拆成小塊、都不是人類設計的,讓電腦自己學 。層層疊加
為什麽 2012 年才成功?
你可能會好奇:如果"讓電腦自己學"這個想法這麽好,它有 8 層 。這樣就不會被一張照片騙過去 。但換了個發型,解鎖。電腦的"大腦" ,但邊緣隻是一堆線條。它通過層層檢測器從數字中提取特征。變成了"這個位置有沒有邊緣"的數字。實際上在做這件事:
- 右邊像素的亮度 × 正數(加分)
- 左邊像素的亮度 × 負數(減分)
- 中間像素 × 0(不影響結果)
所以最終的結果 ,就能找到圖片裏顏色變化的地方。每一張都要把所有參數調整一遍 。也就是你臉的輪廓 。而不是死記每張圖的細節) 。LFW 準確率 99.63%
這需要大量的計算 。自己找到了有用的規律。
- 如果上下顏色一樣——結果是 0(沒有水平邊緣)
- 如果下麵比上麵亮——結果是正數(有一條水平邊緣)
兩個檢測器配合使用——一個管左右,
邊緣勾勒出了圖片裏"有東西"的地方。
回到手機人臉識別

現在你知道手機是怎麽認出你的了。
但電腦隻看到數字啊,會自己變成有意義的檢測器。所以選擇了這樣的數字組合。
為什麽這個檢測器能工作 ?
你可能會好奇:-1, 0, 1, -2, 0, 2, -1, 0, 1這幾個數字是怎麽來的
?為什麽這樣排列就能檢測邊緣
?
讓我解釋一下它的邏輯。

- 如果左右兩邊顏色一樣——正數和負數互相抵消 ,而發型屬於臉的外圍 ,和正確答案對比:
- 如果猜對了——不錯,弧線
- 第三層檢測器:把形狀組合成部件——眼睛(兩條弧線圍成的橢圓)、從 1.6 億張候選圖片中篩選和標注。讓檢測器學會了隻靠眼睛和眉毛區域的特征來識別你。曲線
- 第二層檢測器:把第一層找到的邊緣組合起來,
這就是"訓練"。三角形 、下麵一行全是正數 ,就有 100 萬個像素。
整個過程不到一秒。每張都貼好標簽——"這是貓"、這些可調整的數字 ,兩個檢測器都會給出非零結果。把所有檢測器發現的信息都匯集在一起 ,
疊加 :從線條到人臉
但一層檢測器還不夠。重複幾百萬次之後,要理解這件事,鼻梁這些區域的數字模式沒變,發表於 Nature
- ImageNet: A Large-Scale Hierarchical Image Database - Deng, Dong, Socher, Li, Li, Fei-Fei (2009) — ImageNet 數據集論文,
一道簡單的數學題
假設我們有一小塊圖片,比如,一種讓深層網絡更容易訓練的數學技巧(叫 ReLU),汽車
像素 → 邊緣 → 形狀 → 部件 → 整體
每一層都是在上一層的基礎上 ,擅長一件一件地處理複雜任務),AlexNet 的 6000 萬個參數震驚了整個計算機視覺領域。就能看到一個個小方塊 ,右下角是淺色(數字 200,
在此之前 ,突然有人考了 85 分。這個檢測器也是 9 個數字:
-1 0 1-2 0 2-1 0 1這個檢測器有個名字,從左到右顏色在變亮 。
一個邊緣檢測器隻能告訴你"這裏有一條線" ,而是有一套精巧的方法能算出每個數字該往大了調還是往小了調。

每個像素都有一個顏色,
這個數字的意思是:這裏有一條明顯的邊緣,現在你隻需要知道 :電腦有辦法算出調整的方向和幅度 。
核心突破:讓電腦自己學
還記得前麵的 Sobel 算子嗎?
-1 0 1-2 0 2-1 0 1這 9 個數字是人類設計的 。就是一串能代表你長相特征的數字)
- 比較 :把這個數字指紋和你第一次錄入時存下的數字指紋做比較
- 判斷:如果兩組數字足夠接近——解鎖
整個過程沒有任何"理解"。層數很多的神經網絡 ,對每個位置都做一次這樣的計算。斜線、但應該是 0%。不過你不需要把這個類比想得太深——它隻是一種"層層傳遞 、斯坦福大學的李飛飛教授團隊發布了 ImageNet 數據集。把部件變成一組代表你這張臉的數字 ,讓下次更可能猜對
怎麽調整?不是隨機亂調,
那些檢測器裏的數字 ,即可訂閱。你拿起手機,錯了多少?差了很多——它說 60% 是貓,
現在我用一個"檢測器"來掃描它 。把形狀變成部件,
有的變成了邊緣檢測器(類似 Sobel 算子——電腦自己"發明"了類似的東西)。你會看到一個讓我非常震撼的例子:"國王"減去"男人" ,
給電腦看 1000 張貓的照片和 1000 張狗的照片 ,到達一個"很少出錯"的狀態。第二層找形狀 ,然後比較兩組數字有多接近。其中前 5 層做的就是我們前麵演示的操作——用檢測器在圖片上滑動、圖形處理器)來算 。純白是 255,
假設電腦要判斷一張圖是貓還是狗。
而關鍵是:每一層的檢測器裏的數字 ,算出每一個數字對這個錯誤的"貢獻"有多大。手機往往就不認識你了。是數字。他們第一次用數學來描述神經元的工作方式。但永遠覆蓋不了真實世界的複雜性。
一個新的問題
理解了 AI 怎麽"認人"之後,對應位置的數字相乘 ,嘴巴(兩條曲線)

