Skip to main content

GPT-Image-2.5 プロンプトガイド(日本語訳)

· 15 min read
AICU API Team
api.aicu.ai

OpenAI 公式の GPT Image 2.5 プロンプトガイド(原文)を日本語訳しました。 モデルの選び方、効果的なプロンプトの書き方、編集で細部を保つコツをまとめた実務ガイドです。 例のプロンプトはそのまま使える起点なので、英語のまま掲載し、自分の画像・要件に合わせて調整してください。

概要​

必要な画像から出発し、被写体・構図・スタイル・制約を記述します。編集では「何を変え」「何を変えないか」を明確にし、 一度に一つずつ調整して結果を確認します。

GPT Image 2.5 には 2 つのモデルがあります。GPT Image 2.5 Flare は速度に最適化した小型モデルで、画質は GPT Image 2 相当。 GPT Image 2.5 Sunburst は品質に最適化したベースモデルで、GPT Image 2 より高画質。両モデルとも精密な編集と被写体維持が向上しています。

モデルの選び方​

新しいワークフローでは、速度優先なら Flare、厳しい品質要件が優先なら Sunburst から始めます。要件を満たしたら、待ち時間を減らせないか検討します。

既存モデルからの移行では、いまの画質を出発点にします。両モデルとも生成・編集・透過背景に対応します。

いまのワークフローまず試すもの
検証済みの GPT Image 2 ワークフローが既に品質要件を満たしているFlare。品質を保ったまま待ち時間を減らせるか確認
GPT Image 2 では品質が足りない複雑なユースケースSunburst。まず必要な品質が出ることを確認

Sunburst が要件を満たしたら、同じプロンプト・入力で Flare を試し、同等の品質かつ待ち時間が改善するなら Flare へ切り替えます。 Sunburst の品質優位が必要な場合はそのまま使います。応答時間と品質は自分のワークロードで測定してください(あるワークロードの速度改善が他でも同じとは限りません)。

モデルパラメータ​

API パラメータはプロンプトとは別に設定します。

パラメータGPT Image 2.5 の設定
modelgpt-image-2.5-flare(小型)/ gpt-image-2.5-sunburst(ベース)
qualityauto(既定)/ low / medium / high / xhigh / max
sizeauto または任意解像度。定番: 1024x1024(正方)、1536x1024(横)、1024x1536(縦)、2048x2048(2K 正方)、2048x1152(2K 横)、3840x2160(4K 横)、2160x3840(4K 縦)
backgroundauto / opaque / transparent

任意解像度 幅x高さ の制約:

  • 各辺は 3,840px 以下
  • 各辺は 16 の倍数
  • 長辺 : 短辺は 3:1 以下
  • 総ピクセル数は 655,360〜8,294,400
  • 3,686,400 px(2560x1440)超は実験的

品質は上記のモデル選択後に調整します。最初の比較では、両モデルが対応する品質設定を明示的に固定し、プロンプト・参照画像・出力サイズも揃えます (同じ品質ラベルでも、モデル間で画質・応答時間が同じとは限りません)。

不足なら高い品質設定を試し、要件を満たしたら低い設定でも許容できるか試します。xhigh / max は待ち時間の予算内で、満たせない品質要件を改善する時だけ使います。

:::note api.aicu.ai での xhigh / max api.aicu.ai でも xhigh / max が使えます(2026-09-21 追記。それまでは価格未設定のため 400 quality_not_priced を返していました)。1024×1024 で xhigh 11,400 AP・max 25,600 AP。ただし 60 秒を超えることがあり、その場合は結果がメールで届きます。アプリの中でそのまま待つ用途には low / medium / high を使ってください。詳細は 料金 を参照。 :::

透過アセットは background="transparent" を明示し、PNG か WebP を使います。デコード後のアルファチャンネル(髪・ガラス・影・輪郭)を確認します。output_compression は JPEG / WebP のみ(PNG には使わない)。

既存ワークフローの移行​

  1. ベースラインを保存: 代表的な本番プロンプトと参照画像(難しい編集・正確なテキスト・顔・製品形状・透過アセットを含む)、現行モデル・設定・結果を記録。
  2. 最初の候補を選ぶ: GPT Image 2 で足りていれば Flare から(待ち時間改善を確認)。複雑用途で足りなければ Sunburst から(まず品質を確認)。最初の比較はプロンプト・参照・寸法・出力形式を固定。
  3. 完全な結果を確認: 指示追従、同一性・製品維持、テキスト精度、意図しない変化、透過を比較。同じ要求を繰り返して一貫性を測る。編集は個別ステップと連続シーケンスの両方を検証。
  4. 品質が通ってから待ち時間を評価: Sunburst で始めて要件を満たしたら、同じ要件で Flare を評価。品質が許容でき待ち時間が改善する時だけ切替。
  5. 一度に一設定だけ調整: プロンプト書き換えより先に品質レベルを比較。通常・遅い応答、失敗、リトライ、受理画像あたりのコストを測る。速いモデルが安いと決めつけず、現行料金を確認。
  6. ワークフロー単位で段階展開: 受理基準を通ったら少量のトラフィックから始め、同じ指標を監視して徐々に拡大。ロールバック用に旧モデルを残す。

繰り返し編集は、保つはずの細部を変えてしまうことがあります。制約を再掲し、各結果を確認。ピクセル単位で不変にしたい領域は、プロンプト頼みでなく承認済みの編集を元画像に合成します。

プロンプトの基本(8 原則)​

  1. 結果を定義する: 被写体と用途(製品写真・広告・図解など)を挙げ、構図・アスペクト比・重要な配置制約を指定。複雑なら「シーン/被写体/詳細/制約」のラベル付き節に整理。
  2. 保守しやすい形式を選ぶ: 短文・記述段落・JSON 風・命令・タグ、どれでも同じ意図を表せる。特殊構文に頼らず、読みやすく更新しやすい形式を選ぶ。
  3. 見える詳細を記述: 素材・照明・色・視覚媒体を挙げる。目的なら「photorealistic」「real photograph」を明示。カメラ諸元は「見た目のヒント」であって物理シミュレーションの保証ではない。広角・シネマ・低照度・雨・ネオンは、雰囲気語だけでなく規模・空気感・色を指定。
  4. 人物と動作を指定: 身体のフレーミング、相対サイズ、視線、物との関わり。「full body visible, feet included」「looking down at the open book」「hands naturally gripping the handlebars」のように具体的に。
  5. 正確なテキストを指定: 必要な文言を引用符で囲み、位置とタイポグラフィを記述。珍しい語・ブランド名は一文字ずつ綴る。余計なテキストは禁止と伝え、出力の綴り・可読性を確認。小さな文字・密な情報は medium と high を比較。
  6. 変更と制約を分ける: 編集は「change only X」と言い、保つ詳細(同一性・幾何・レイアウト・照明・ラベル)を列挙。除外(不要なテキスト・ロゴ・透かし)も明示。精密な局所編集では、彩度・コントラスト・矢印・カメラ角度・周囲の物も「不変」と指定。
  7. 参照に役割を割り当てる: 各入力を番号と用途(被写体・スタイル・服・背景)で識別。どう組み合わせ、どの要素をどこへ動かすかを説明。
  8. 意図的に反復する: 前の出力を次の編集入力に渡し、一度に一つ変更し、保つ詳細を再掲。「same style as before」等は文脈を運ぶが、ドリフトしたら重要な制約を再掲。指示を足す前に結果を比較。

以下の例はそれぞれ別の技法を示します。プロンプトは起点として、自分の画像・要件に合わせて調整してください。

画像生成の例​

各例の設定と、そのまま使えるプロンプト(英語)を掲載します。

スタイルと照明の制御(size="1024x1536", quality="medium")— 被写体・フレーミング・光・質感で写真を記述し、過度なレタッチを明示的に除外。

Create a photorealistic candid photograph of an elderly sailor standing on a small fishing boat.
He has weathered skin with visible wrinkles, pores, and sun texture, and a few faded traditional sailor tattoos on his arms.
He is calmly adjusting a net while his dog sits nearby on the deck. Shot like a 35mm film photograph, medium close-up at eye level, using a 50mm lens.
Soft coastal daylight, shallow depth of field, subtle film grain, natural color balance.
The image should feel honest and unposed, with real skin texture, worn materials, and everyday detail. No glamorization, no heavy retouching.

プロセスを図解する(1024x1536, medium)— 図・情報グラフィックはラベルと事実関係も検証。

Create a detailed Infographic of the functioning and flow of an automatic coffee machine like a Jura.
From bean basket, to grinding, to scale, water tank, boiler, etc.
I'd like to understand technically and visually the flow.

正確なテキストを描画(1024x1536, medium)— 文言を引用し、出現回数と視覚処理を指定。

Give me a cool in culture ad / fashion shot for a brand called Thread.
It's a hip young street brand. The ad shows a group of friends hanging out together with the tagline "Yours to Create."
Make it feel like a polished campaign image for a youth streetwear audience: stylish, contemporary, energetic, and tasteful.
Use clean composition, strong color direction, natural poses, and premium fashion photography cues.
Render the tagline exactly once, clearly and legibly, integrated into the ad layout.
No extra text, no watermarks, no unrelated logos.

再利用できるロゴを設計(1024x1536, medium, background="transparent", output_format="png", n=1)— ブランドと形状を記述、小さくても読める構図に。n で複数バリエーション。

Create an original, non-infringing logo for a company called Field & Flour, a local bakery.
The logo should feel warm, simple, and timeless. Use clean, vector-like shapes, a strong silhouette, and balanced negative space.
Favor simplicity over detail so it reads clearly at small and large sizes. Flat design, minimal strokes, no gradients unless essential.
Fully transparent background. Deliver a single centered logo with generous padding, clean alpha edges, and no solid backdrop, scenery, checkerboard, or watermark.

歴史・実世界の文脈(1024x1536, medium)— 場所と日付で時代設定。衣装・演出・環境の史実性を確認。

Create a realistic outdoor crowd scene in Bethel, New York on August 16, 1969.
Photorealistic, period-accurate clothing, staging, and environment.

物語をコマ漫画に(1024x1536, medium)— 物語を「1 コマ 1 ビート」の明確な視覚に分解。

Create a short vertical comic-style reel with 4 panels.
Panel 1: The owner leaves through the front door. The pet is framed in the window behind them, small against the glass, eyes wide, paws pressed high, the house suddenly quiet.
Panel 2: The door clicks shut. Silence breaks. The pet slowly turns toward the empty house, posture shifting, eyes sharp with possibility.
Panel 3: The house transformed. The pet sprawls across the couch like it owns the place, crumbs nearby, sunlight cutting across the room like a spotlight.
Panel 4: The door opens. The pet is seated perfectly by the entrance, alert and composed, as if nothing happened.

UI プレビュー(1024x1536, medium)— 「既に存在する製品」として記述。レイアウト・階層・余白・実際の UI 要素に集中し、コンセプトアート語を避ける。

科学・教育ビジュアル(1536x1024, high)— 授業設計ブリーフのように、対象・学習目標・形式・必須ラベル・科学的制約を定義。密なラベルは high。

Create a simple biology diagram titled "Cellular Respiration at a Glance" for high school students.
Show how glucose turns into energy inside a cell. Include glycolysis, the Krebs cycle, and the electron transport chain.
Use arrows to connect the steps, and label the main molecules: glucose, pyruvate, ATP, NADH, FADH2, CO2, O2, and H2O.
Make it look like a clean classroom handout or slide, with a white background, simple icons, clear labels, and easy-to-read text.
Avoid tiny text, extra decoration, or anything that makes the diagram hard to understand.

スライド・図表・チャート(1536x864, high)— 「成果物の仕様書」として、正確なテキスト・データを与える。小さな文字・凡例・軸・脚注があるなら high。数値・出典はダミーであり、使用前に検証済みデータに差し替える。

画像編集の例​

client.images.edit(参照入力画像つき)を使います。マスクが要る局所編集はマスク編集を参照。

  • レイアウトを保って翻訳(1024x1536, high): Translate the text in the infographic to Spanish. Do not change any other aspect of the image.
  • スタイル転写(1024x1536, medium): 参照画像に「パレット/質感/媒体」の役割を割り当て、新しい被写体は別に記述。Use the same style from the input image and generate a man riding a motorcycle on a white background.
  • 同一性を保って服だけ変える(1024x1536, medium): 人物写真+服の参照を渡し、「顔・肌・体型・ポーズは不変、服だけ変更」と明示。
  • 参照を合成(1024x1536, medium): image 1=シーン、image 2=対象、動かす要素と保つ要素を指定。
  • 透過の切り抜き(1024x1536, medium, background="transparent", output_format="png"): プロンプトで被写体の分離を要求し、API で透過を指定。市松模様は透過ではない。
  • 線画→写実(1024x1536, medium): レイアウト・比率・遠近を保ち、素材と照明で写実化。Do not add new elements or text.
  • 物体を消す(1024x1536, medium): Remove the flower from man's hand. Do not change anything else.
  • 人物をシーンに挿入(1024x1536, medium): 同一性を保ちつつ新しいシーンへ。保つ顔の特徴と比率を明示(gpt-image-2 では input_fidelity を省く=常に高忠実度)。
  • ターンをまたいで洗練: 1 つの出力を次の入力にし、変更は毎回一つに絞る。

そのほかのワークフロー​

  • 部屋の家具を変える(1536x1024, medium): カメラ角度・照明・影・周囲を保ち、1 つの物だけ差し替える「外科的な写実」。
  • ホリデーカード(1024x1536, medium): シーン・情感・素材・照明・正確なコピーを記述。カード文言は verbatim で。
  • コレクタブル商品(1024x1536, medium): 素材・パッケージ・印刷の鮮明さを製品写真の語彙で。オリジナルで非侵害に。

キャラクターの一貫性を保つ​

複数の挿絵がある本などでは、再利用できるキャラクター参照を作り、シーン・ポーズ・ページをまたいで見た目を保ちます。 まずキャラの外見・比率・衣装・トーンを確立し(generation)、続く各シーンで外見の制約を再掲しながら環境と物語だけ変えます(edit)。

大量生成(バッチ)のサンプル — api.aicu.ai​

Flare は「ラピッドプロトタイピング・大量生成」に向いています。api.aicu.ai は OpenAI 互換なので、 同じプロンプトの複数バリエーションや、多数のプロンプトを一括で回すのも簡単です。下は同時実行で まとめて生成する Python サンプル(AICU_API_KEY を使用)。

import os, base64, concurrent.futures as cf, urllib.request, json

API = "https://api.aicu.ai/v1/images/generations"
KEY = os.environ["AICU_API_KEY"] # aicu_live_...

def generate(i, prompt):
body = json.dumps({"model": "gpt-image-2.5-flare",
"size": "1024x1024", "quality": "high",
"prompt": prompt}).encode()
req = urllib.request.Request(API, data=body, method="POST")
req.add_header("Authorization", f"Bearer {KEY}")
req.add_header("Content-Type", "application/json")
d = json.load(urllib.request.urlopen(req, timeout=180))
open(f"out_{i:02d}.png", "wb").write(base64.b64decode(d["data"][0]["b64_json"]))
return i

prompts = [f"a cute mascot robot, pose variation {i}, studio lighting, no text"
for i in range(10)]

# 同時 4 本で 10 枚を一括生成(大量生成・歩留まり評価にも使える形)
with cf.ThreadPoolExecutor(max_workers=4) as ex:
for done in ex.map(lambda a: generate(*a), enumerate(prompts)):
print("done", done)
  • 残高(AP)は成功呼び出しに応じて消費され、残高ゼロで自動停止します(想定外の請求は出ません)。
  • 100 秒を超える生成は、stream の X-AICU-Image-Id で id を受け取り /v1/images/status/:id でポーリングして回収できます(大量・高解像度で有効)。

:::note バッチと料金について(OpenAI 公式) GPT-Image-2.5(Flare / Sunburst)には「バッチ料金」の設定がありません。=非同期 Batch モードは無く、標準の同期生成のみ。十分に高速だからバッチ枠を設けていない、という位置づけです(バッチ枠があるのは旧 gpt-image-2)。 また Flare と Sunburst は同一料金(画像 入力 $8 / キャッシュ $2 / 出力 $30、テキスト $5 / $1.25・いずれも 1M tokens 単位)。価格差はなく、違いは「品質」と「待ち時間」だけ。だから「大量生成」は上のように同時実行で回すのが実務的です。(最新の公式料金は OpenAI API pricing。) :::

結果を確認する​

使う前に、要件に照らして確認します。

  • 必要なテキストは正確・可読か。図のラベルと関係は正しいか。
  • 同一性・製品形状・ラベル・参照の細部は保たれているか。
  • 編集は要求した箇所だけを変えたか。
  • 透過が必要なら、塗られた背景でなくアルファチャンネルを含むか。

プロンプトやモデルを変えるときは、代表的な入力で品質・待ち時間・コストを比較します(現行の料金は OpenAI の公式料金ページ を参照)。


本記事は OpenAI 公式「GPT Image 2.5 prompting guide」の日本語訳です(原文)。例のプロンプトは起点として自由に調整してください。