本書は、AIを活用して動画の内容そのものから検索を可能にする技術の実装方法を扱います。現在の動画検索がタイトルや説明文といったメタデータに依存し、動画の中身を直接検索できないという課題に対し、本書は映像・音声・テキストのマルチモーダル解析による動画理解の仕組みと、従来の検索方法との違いを明確に提示します。動画からシーン検索を実現するための基礎パイプライン構築では、動画の読み込みとメタデータ取得から始まり、シーン境界の検出、音声認識とOCRによるテキスト抽出、画像キャプション生成、そしてマルチモーダル埋め込みを経て検索インデックスを構築するまでの一連の流れを、実際に動作するコードとともに紹介し、さらに埋め込みベクトルの概念や類似度計算、効率的な検索を実現するベクトルデータベースの活用方法を詳述します。加えて、RAGの基本的な仕組みとその動画検索への応用を通じて、検索と生成を組み合わせることでより精度の高い検索結果を提供できる理由を解説し、デモアプリケーションを使って動画のアップロードからシーン解析、ベクトル登録、自然言語検索までを一気通貫で試せるよう構成されています。 動画解析やマルチモーダルAIに興味がある方には必見の一冊です。
【目次】
はじめに
第1章 動画検索について
第2章 内容ベース動画検索
第3章 動画シーン検索の基礎パイプライン構築
第4章 検索基盤の構築
第5章 RAGで広がる動画シーン検索
第6章 デモアプリvideo-searchを動かす
第7章 動画検索の精度を向上させるための手法
第8章 実践的なユースケース
第9章 トラブルシューティング
おわりに
-
5.1 RAGの基本構造
-
5.2 シーン情報を整理する
-
5.3 Retriever設計の考え方
-
5.4 プロンプトで「引用するクセ」を付ける
-
5.5 小さく試す実装例
-
5.6 回答品質の確認
-
5.7 動画シーン検索への応用
-
6.1 デモアプリの輪郭
-
6.2 ディレクトリー構成
-
6.3 アップロードから検索までの流れ
-
6.4 Qdrantが支える検索体験
-
6.5 手元で動かしてみる
-
6.6 動作の確認ポイント
-
6.7 実際に確認
-
6.8 検索結果の読み方
-
6.9 まとめ
-
8.1 講義動画からの知識検索
-
8.2 料理動画からの手順検索
-
8.3 スポーツ動画からのハイライト検索
-
8.4 監視カメラ映像からの事象検索
-
8.5 ユースケース横断のまとめ
-
9.1 環境構築でよくある問題
-
9.2 モデルのダウンロードと読み込みの問題
-
9.3 検索精度が出ないときの切り分け手順
-
9.4 処理速度の改善