画像分類

【画像分類】AutoGluonでImageNet-1k(1000クラス、約129万枚の画像)を学習させる

はじめにImageNet-22kというのもありますが今回はImageNet-1kで妥協しました。1000クラスの画像分類で、訓練用画像だけで約129万枚あります。Kaggleからダウンロードできます。今回の学習は「swinv2_cr_large_224」というモデルを使いました。こちらは現時点…

AutoGluonで学習していないTIMM(PyTorch Image Models)を使用する方法

はじめに predictor = MultiModalPredictor( problem_type="multiclass", label="label" ) hyperparameters = { "model.timm_image.checkpoint_name": "swinv2_cr_large_224.untrained", "optim.optim_type": "adamw" } このように普通に使おうとすると以下…

色々なCAMを使ってみる

はじめに今回はこちらの拡張です。 touch-sp.hatenablog.com 環境 Ubuntu 24.04 on WSL2 Python 3.12.3 CUDA 12.6環境構築 pip install autogluon pip install git+https://github.com/jacobgil/pytorch-grad-cam実行キノコ分類の学習はすでに済ませている前…

6年ぶりにGrad-CAMをやってみる

以前の記事はこちら。 touch-sp.hatenablog.com MXNetやGluonCVを使っています。懐かしいです。 今回はこちらを使わせてもらいました。 github.com 結果 === Top 5 予測(ラベル付き) === Rank 1: water bottle (0.9660) Rank 2: pop bottle (0.0174) Rank …

【画像分類】AutoGluon の MultiModalPredictor でキノコの分類をやってみる

はじめに データの準備 使用する画像をランダムに選択 学習データとテストデータに分割 学習 テストデータを用いた検証 出力 詳細な出力のためのスクリプト 出力 補足 環境 MultiModalPredictor関連記事 はじめに以前「犬と猫の画像分類」を行いました。 久…

リクルート社が発表した「japanese-clip-vit-b-32-roberta-base」を使って日本語で画像検索をする

前回に引き続きリクルート社が発表した「japanese-clip-vit-b-32-roberta-base」を使っていきます。 touch-sp.hatenablog.com 今回は日本語での画像検索に挑戦しました。 1年以上前にOpenAIのCLIPを使って同じことをした経験があります。 touch-sp.hatenablo…

リクルート社が発表した「japanese-clip-vit-b-32-roberta-base」を使って日本語でゼロショット画像分類を行う

1年以上前にOpenAIのCLIPを使ってゼロショット画像分類に挑戦した経験があります。 touch-sp.hatenablog.com 今回リクルート社が発表した「japanese-clip-vit-b-32-roberta-base」を使って日本語でゼロショット画像分類に挑戦しました。 huggingface.co 用意…

【ゼロショット画像分類】AutoGluonとTransformersでそれぞれゼロショット画像分類(Zero-Shot Image Classification)を実行。どちらが簡潔に書けるか?

画像 AutoGluonPythonスクリプト from autogluon.multimodal import download, MultiModalPredictor segway_image = download( "https://live.staticflickr.com/7236/7114602897_9cf00b2820_b.jpg") predictor = MultiModalPredictor(problem_type="zero_sho…

【AutoGluon】【Zero-Shot Image Classification】OpenAIのCLIP(Contrastive Language-Image Pre-Training)がAutoGluonから簡単に使えるようです

AutoGluonからOpenAIのCLIP(Contrastive Language-Image Pre-Training)を使ってゼロショット画像分類(Zero-Shot Image Classification)を行いました。AutoGluonからCLIPが簡単に使用できます。

【画像分類】AutoGluon の MultiModalPredictor で「dogs vs cats」をやってみる

公開日:2022年3月14日 最終更新日:2022年9月14日 はじめに データの準備 学習 Pythonスクリプト 出力 テストデータを用いた検証 Pythonスクリプト 出力 推論 画像 Pythonスクリプト 出力 結果 環境 MultiModalPredictor関連記事 はじめに犬と猫の画像分類…

【AutoGluon】【画像分類】最新のAutoGluonで「dogs vs cats」をやってみる

データセットの作成 学習 Pythonスクリプト 学習結果 テストデータを用いた検証 Pythonスクリプト 検証結果 推論 Pythonスクリプト 推論結果 動作環境 追記 データセットの作成データはこちらからダウンロードさせて頂きました。 import glob import random …

【AutoGluon】【画像分類】数行のコードで人と同等の精度が出せるのか?

AutoGluonを使って画像分類を行いました。