コンピュータビジョンとは — 機械が「見る」ということ
カメラに映った世界は、コンピュータにとってはただの巨大な数値の表です。その数値の表から「何が」「どこに」あるかを取り出す技術がコンピュータビジョン(CV)。まずは代表タスクの全体地図と、この分野が本質的に難しい理由 — セマンティックギャップ — を、動かしながらつかみます。
1. 「見る」は1つじゃない — 4つの代表タスク
同じ1枚の画像でも、何を答えてほしいかによってタスクは別物になります。代表は次の4つです。
- 分類:画像全体を見て、ラベルを1つ答える(「これは道路の写真」)
- 物体検出:物体ごとに箱(バウンディングボックス)とラベルを答える
- セマンティック分割:画素1つ1つにクラスの色を塗り分ける
- 追跡:動画の中で、動く物体に同じIDを付け続ける
下のデモはすべて同じ道路シーン。ボタンでタスクを切り替えて、出力の形がどう変わるかを見比べてください。
タスクの全体地図 — 同じシーン、違う質問
「追跡」では車と歩行者が動き出し、それぞれのIDと軌跡(トラック)が描かれます。「分割」では画素単位でクラス色が塗られることに注目。
POINT — 出力の形がタスクを決める
分類=ラベル1個、検出=箱のリスト、分割=画像と同じ大きさのラベル地図、追跡=時間をまたぐID対応表。入力は同じ画像でも、「答えの形」が違えば別のタスクであり、必要な技術も変わる。
2. 画像の正体は数値の表 — 人は文脈で見る、機械は数値で見る
コンピュータにとって画像とは、画素(ピクセル)ごとに明るさや色を並べた整数の格子にすぎません。
I(x, y) = (R, G, B) 各値は 0〜255 の整数
フルHDの写真1枚 = 1920 × 1080 × 3 ≒ 622万個の数値の表。機械が見ているのはこれが全部
一方、人間の視覚は数値をそのまま見ていません。影や照明を脳が自動補正して「モノ本来の色」を推定しています。それを体感できるのが次の錯視。AとBのマス、どちらが明るく見えますか?
チェッカーシャドウ錯視 — 同じ画素値なのに違って見える
ボタンを押すと A と B が同じ色の帯でつながります
Aは影の外の「暗いマス」、Bは影の中の「明るいマス」。実はどちらも全く同じ RGB(115, 115, 115) で塗られています。人間の脳は「影の中は実際より暗く写っているはず」と補正するため、Bを明るく感じるのです。
注意 — 機械はだまされない代わりに、文脈も知らない
機械は画素値をそのまま読むのでこの錯視にはかかりません。しかし裏を返せば、照明が変わって数値が変わると「別物」に見えてしまうということ。人間が無意識にやっている文脈補正を、CVは全部自力で解決しなければなりません。
3. セマンティックギャップ — 「意味」と「数値」の距離
CVが難しい根本理由がこれです。人間にとって「猫」という意味は1つでも、向き・色・大きさ・ポーズが変われば画素の数値配列はまったくの別物になります。この「意味の世界」と「数値の世界」のずれをセマンティックギャップと呼びます。
どれくらい深刻か、生画素どうしの距離を実際に測ってみましょう。
d(A, B) = √( Σ (ai − bi)² )
生画素のユークリッド距離。下のデモでは 16×16 の画像で、1画素あたりの平均差(0〜255)として表示
セマンティックギャップ — 一番「近い」のはまさかの犬
3匹の猫(B・C)と1匹の犬(D)を、基準の猫Aと生画素で比較。B・C・Dの画像をクリックすると、Aとの画素差ヒートマップ(赤いほど差が大きい)が左下に表示されます。姿勢がそっくりな犬Dが最小距離になる一方、同じ猫のはずのBは向きと明るさが違うだけで最大距離になります。
POINT — 画素の近さ ≠ 意味の近さ
生画素のユークリッド距離が測っているのは「同じ場所の画素が同じ明るさか」だけ。意味(猫か犬か)とはほとんど無関係。だからCVの歴史は、「意味の近さ」がそのまま「数値の近さ」になるような表現(特徴)を作る戦いだった。
4. どうやって乗り越えてきたか — 3つの時代
セマンティックギャップへの挑戦は、大きく3段階で進化しました。
- ルールベースの時代:「猫は耳が三角で…」と人間が判定ルールを手書き。現実の多様さの前にほぼ全滅。
- 特徴設計の時代:照明や位置に強い特徴量(HOG・SIFTなど)を人間が設計し、その上で機械学習。顔検出などが実用化。
- 深層学習の時代:特徴の設計そのものをデータから学習。2012年を境に精度が飛躍し、現在の主流に。
一歩先へ — 「ひと夏で解ける」と思われていた
1966年、MITの「Summer Vision Project」は学生の夏休み課題として画像認識に着手した — 60年経った今も研究が続く難問だとは知らずに。その後、2001年の Viola–Jones 顔検出(デジカメの顔枠)、1999年のSIFT・2005年のHOGという特徴設計の傑作を経て、2012年のAlexNetが画像分類コンテストILSVRCで従来手法に圧勝。CVは深層学習時代へ一気に舵を切った。次のレッスンでは、この2番目の時代を支えた「特徴」の直感を学ぶ。
5. まとめ
- 代表タスク:分類(ラベル1つ)・検出(箱)・セマンティック分割(画素ごと)・追跡(時間方向のID)。答えの形がタスクを決める。
- 画像=数値の表:機械は文脈補正なしで数値をそのまま見る。照明が変われば数値は全部変わる。
- セマンティックギャップ:生画素の距離は意味の距離ではない。これを埋める「表現づくり」がCVの中心課題。
- 歴史:ルール手書き → 特徴を設計 → 特徴を学習、の3段階で進化してきた。