4.1 コンピュータビジョン入門

CV とは何か?

コンピュータビジョン (CV) は人工知能の一分野であり、コンピュータが画像や動画など現実世界の視覚情報を解釈し理解できるようにします。ディープラーニングやパターン認識などの技術を使うことで、コンピュータビジョンシステムは物体の識別、顔検出、動きの追跡、シーンの分析を高精度で行えます。自動運転、医療画像、セキュリティ監視、産業検査、拡張現実などの応用に広く使われており、機械が「見た」ものに基づいて意思決定するのを助けます。

img

学習目標

このセクションを終える頃には、次のことができるようになるはずです:

  • コンピュータビジョンとは何かを説明する
  • この分野が解決しようとしている主な問題を述べる
  • 主要な応用分野を特定する
  • 画像理解と動画理解の違いを理解する
  • 本コースの残りの構成を把握する

コンピュータビジョンが難しい理由

人間は世界での身体的経験を長年積み重ねているため、多くの視覚タスクを楽にこなせます。コンピュータはそうではありません。現実世界での視覚が難しいのは次の理由からです:

  • 照明が変化する
  • 物体は視点が変わると見え方が異なる
  • シーンが雑然としている
  • 一部の物体は小さい、ぼやけている、または遮蔽されている
  • カメラはノイズや歪みをもたらす
  • 動画は時間という別の次元を加える

これがコンピュータビジョンが単純な画像処理からディープラーニングやマルチモーダルシステムへと進化してきた理由です。

コンピュータビジョンの主要なタスク

img

この分野はいくつかの主要なタスクに分けられます:

タスク中心的な問い
分類画像に何が写っているか猫対犬、欠陥品対正常品
検出どんな物体がどこにあるか人、ヘルメット、車両
セグメンテーションどのピクセルがどの領域や物体に属するか道路領域、背景、製品の輪郭
姿勢推定キーポイントや身体構造はどうなっているか人体の関節、手のランドマーク
トラッキング検出された物体が時間とともに同じ物体か動画を通して人物 17 番を追跡
OCRシーンに現れる文字は何かナンバープレート、ラベル、レシート
イベント理解シーンで何が起こったか線越え、侵入、転倒

画像対動画

画像は単一の瞬間を捉えます。動画は時間とともに進行するフレームの系列です。

この区別が重要なのは、1 枚の画像から解けるタスクもあれば、時間的推論が必要なタスクもあるからです:

  • 画像分類は 1 フレームで動作する
  • 物体追跡はフレーム間の連続性を必要とする
  • イベント解析は動きと時間に依存する

標準的なビジョンパイプライン

image-20260330175514717

実装はさまざまですが、多くのコンピュータビジョンシステムは共通のロジックに従います:

  1. データを取得する
  2. データを前処理する
  3. アルゴリズムまたはモデルを実行する
  4. 後処理と判断ロジックを適用する
  5. 結果を出力するか、アクションをトリガーする

よくある誤解

  • 「コンピュータビジョンとは物体検出のことだ。」
    • 検出は重要ですが、この分野はもっと広いです。
  • 「1 枚の画像で動くモデルなら、デプロイ準備完了だ。」
    • 実運用には安定した入力、レイテンシ制御、障害処理が必要です。
  • 「動画は画像の集まりに過ぎず、それほど難しくない。」
    • 動画は時間、連続性、システム制約をもたらします。

演習 / リフレクション

  1. 日常で使う製品やシステムを 3 つ挙げ、コンピュータビジョンが関わっている可能性のある部分を見つけてください。
  2. 次のそれぞれが、主に分類、検出、セグメンテーション、トラッキング、イベント理解のどのタスクに該当するか判断してください:
    • スマートフォンの顔認証ロック解除
    • 駐車場での車両カウント
    • レシートの読み取り
    • 作業員がヘルメットを着用しているかの検出
  3. 動画理解が画像理解より難しいことが多い理由を、短い段落で説明してください。

まとめ

コンピュータビジョンは、生の視覚データを有用な理解へと変換することを目的としています。分類や検出から OCR、イベント推論まで、多様なタスクを含みます。