Gemini APIとは?Google AI Studioでできること
📋 この記事でわかること
- ✅ 基本的な使い方と設定方法
- ✅ 実際の業務での活用例
- ✅ よくあるエラーと解決方法
- ✅ 効率的に使うためのコツ
近年、生成AIを活用したアプリ開発が急速に広がっています。中でもGoogleが提供する「Gemini API」は、テキスト生成だけでなく画像認識や音声処理などマルチモーダルな機能を持ち、エンジニアにとって非常に魅力的なツールです。しかし、「Gemini APIの使い方がわからない」「Google AI Studioってどうやって使うの?」といった悩みを持つ方も多いのではないでしょうか。
本記事では、実際に筆者がGemini APIを使って画像認識アプリを開発した体験を交えながら、基本的な使い方からGoogle AI Studioでの環境構築、実践的なコード例までを詳しく解説します。これを読めば、あなたもすぐにGemini APIを使いこなせるようになります。
Google AI Studioでの環境構築とAPIキー取得方法
Google AI Studioとは
Google AI Studioは、Gemini APIをブラウザ上で手軽に試せる開発環境です。コードを書かずにプロンプトのテストができるため、APIの動作確認やアイデアの検証に最適です。また、APIキーの発行もここから行います。
APIキーの取得手順
- Google AI Studio(aistudio.google.com)にアクセスし、Googleアカウントでログインします。
- 画面右上の「Get API key」ボタンをクリックします。
- 「Create API key」を選択し、新しいAPIキーを作成します。
- 生成されたAPIキーをコピーして安全な場所に保管します。
APIキーは秘密情報なので、GitHubなどに公開しないよう注意してください。筆者の場合、環境変数に設定して管理しました。
Gemini APIの基本的な使い方:テキスト生成から始めよう
Pythonでのシンプルな呼び出し例
まずは最も基本的なテキスト生成を行ってみましょう。Pythonを使用し、Googleが公式に提供している「google-generativeai」ライブラリを使います。
import google.generativeai as genai
# APIキーを設定
genai.configure(api_key='YOUR_API_KEY')
# モデルを選択
model = genai.GenerativeModel('gemini-pro')
# テキスト生成
response = model.generate_content('こんにちは、自己紹介をしてください。')
print(response.text)
このように、数行のコードでGemini APIを呼び出すことができます。モデル名は「gemini-pro」がテキスト生成用、「gemini-pro-vision」が画像認識用です。
パラメータの設定
生成結果をカスタマイズするには、generation_configを設定します。
response = model.generate_content(
'AIについて教えて',
generation_config=genai.types.GenerationConfig(
max_output_tokens=500,
temperature=0.7
)
)
temperatureを低くすると決定論的な回答に、高くすると創造的な回答になります。用途に応じて調整しましょう。
画像認識アプリ開発の実践:Gemini APIで作る物体検出ツール
ここからは、筆者が実際に開発した画像認識アプリの事例を紹介します。Gemini APIのvisionモデルを使うことで、画像内の物体を検出し、その説明をテキストで返すアプリを作成しました。
必要なライブラリのインストール
pip install google-generativeai pillow
画像認識コードの実装
import google.generativeai as genai
from PIL import Image
# APIキー設定
genai.configure(api_key='YOUR_API_KEY')
# 画像認識モデルを選択
model = genai.GenerativeModel('gemini-pro-vision')
# 画像を読み込み
img = Image.open('sample.jpg')
# 画像とプロンプトを渡して生成
response = model.generate_content(['この画像に写っているものを詳しく説明してください。', img])
print(response.text)
このコードでは、画像ファイルを読み込み、プロンプトと一緒にモデルに渡すだけで、画像の内容をテキストで返してくれます。実際に使ってみると、物体の種類だけでなく、色や配置、背景の情報まで詳細に認識してくれるのに驚きました。
応用:複数画像の処理やバッチ処理
複数の画像を処理する場合は、ループ処理を組み合わせます。また、Google Cloud Storageに画像をアップロードして、URLを直接渡すことも可能です。
Gemini APIとGoogle AI Studioの料金体系と無料枠
開発を進める上で気になるのが料金です。Gemini APIには無料枠が用意されており、小規模なアプリ開発や学習用途であれば十分に活用できます。
| プラン | 料金 | 特徴 |
|---|---|---|
| Free Tier | 無料 | 1分あたり60リクエスト、1日あたり500リクエストまで |
| Blaze(従量課金) | 従量制 | 無料枠を超えた分だけ課金。1,000文字あたり約0.002ドル〜 |
筆者の開発では、無料枠で十分テストができました。本番運用する際は、Blazeプランに切り替えることで、より多くのリクエストを処理できます。
コストを抑えるポイント
- 不要なAPI呼び出しを避けるため、キャッシュを活用する
- プロンプトを簡潔にしてトークン数を減らす
- バッチ処理でまとめてリクエストする
Gemini APIを使った開発の注意点とベストプラクティス
エラーハンドリングとリトライ処理
APIを利用する際は、ネットワークエラーやレート制限に備えたエラーハンドリングが重要です。
import time
try:
response = model.generate_content('テスト')
except Exception as e:
print(f'エラー: {e}')
time.sleep(5) # 5秒待ってからリトライ
response = model.generate_content('テスト')
セキュリティ対策
APIキーをコードに直接書かず、環境変数やシークレット管理サービスを利用しましょう。また、ユーザー入力をそのままプロンプトに使用する場合は、プロンプトインジェクション対策が必要です。
モデルの選択
Gemini APIには複数のモデルがあります。
- gemini-pro:テキスト生成に特化
- gemini-pro-vision:画像認識に対応
- gemini-ultra:最高性能(現在は一部ユーザーのみ)
用途に応じて最適なモデルを選ぶことで、コストと性能のバランスを最適化できます。
🔍 あなたに合った記事を探す
まとめ:Gemini APIで開発の幅を広げよう
今回は、Gemini APIの基本的な使い方から、Google AI Studioでの環境構築、実際の画像認識アプリ開発までを解説しました。筆者の体験では、APIの導入が非常に簡単で、数時間でプロトタイプが完成しました。また、ドキュメントが充実しているため、困ったときもすぐに解決できます。
Gemini APIは、テキスト生成だけでなく画像認識や音声処理など多岐にわたる機能を提供しており、エンジニアの開発効率を大きく向上させてくれます。ぜひこの記事を参考に、あなたもGemini APIを使ったアプリ開発に挑戦してみてください。
❓ よくある質問(FAQ)
Q. Gemini APIは無料で使えますか?
A. Gemini APIには無料プランまたは無料トライアルが用意されています。まずは無料で試してから有料プランへの移行を検討することをおすすめします。
Q. Gemini APIは日本語に対応していますか?
A. Gemini APIは日本語UIに対応しており、日本のユーザーも問題なく利用できます。
Q. Gemini APIの料金はいくらですか?
A. Gemini APIの料金はプランによって異なります。詳細は公式サイトの料金ページでご確認ください。無料トライアルを活用して自分に合うプランを選びましょう。


