xAI の画像モデルが OVOV に登場。プロンプトを書き、7 種類のアスペクト比から 1 つを選ぶだけで、約 30 秒で 1 枚が仕上がります——画質モードは 1 つ、調整する項目はなし、1 枚 6 クレジットです。
各モデル名およびロゴは、それぞれの所有者の商標です。OVOV は独立した製品であり、いかなるモデル提供元とも提携・推奨・スポンサー関係はありません。
すべて OVOV 上の Grok Imagine 2.0 がテキストプロンプトだけで生成した実際の出力です——選り好みも後加工もしていません。

Photorealistic street photograph of an overloaded municipal sign pole on a quiet residential corner,...

A photo taken on a cheap digital camera in the summer of 2004 at a suburban backyard barbecue. Shot ...

High-fashion magazine cover, extreme close-up of an avant-garde metallic sculpture instead of a mode...

Realistic photograph of a full-size passenger train running along the crest of an ocean wave, spray ...

A professionally shot photorealistic diagram of four regional dumplings on a white background, each ...

A screenshot from a fictional 16-bit turn-based RPG battle scene, pixel art, limited palette. The bo...

A vintage 1970s disaster-movie poster, offset-printed on slightly yellowed stock. Painted illustrati...

A cliffside monastery carved directly into black basalt, seen from across a fjord in the minutes bef...

A character reference sheet for a stop-motion film, laid out on grey card. One fox character in felt...
xAI の画像モデルは意図的に用途を絞っています:テキストを入れると、画像が 1 枚出てくるだけ。アップロードもダイヤルも待ち時間もなく、プロンプトと 1 枚のフレームだけの世界です。
Grok Imagine 2.0 には xAI が学習させたハウススタイルが宿っています——強いコントラスト、迷いのない色、そしてシュールなものへの嗜好。プロンプトを無難なストック画像に平均化せず、態度をもって読み取ります。
プロンプトを入れれば画像が出ます。Grok Imagine 2.0 は純粋なテキスト画像生成モデルです——画像のアップロードは受け付けず、すでにある画像を描き直したりレタッチしたりもできません。すべてのフレームがあなたの言葉だけから生成されます。
1 回の生成は 30 秒ほどで届くので、一文を書き直してもう一度走らせることが、コーヒーブレイクではなく通常の工程になります。
1:1、2:3、3:2、3:4、4:3、9:16、16:9 から選べます——アイコンには正方形、スマホ画面やストーリーズには縦長、バナーやヘッダーには横長を。
解像度の段階を比べて悩む必要はありません。Grok Imagine 2.0 は固定された 1 つの画質モードで描画し、選んだアスペクト比がフレームの形を決めます。
1 回の生成は 6 クレジットで、画像は 1 枚。どの比率を選んでも料金は同じです。生成に失敗した場合、クレジットはそのまま残高に戻ります。
アップロードするものも設定する項目もありません——書いて、形を選んで、ダウンロードするだけです。
被写体、舞台、そして質感を描写します。参照画像のアップロードが使えない以上、欲しいディテールはすべて文章の中に書き込む必要があります。
7 種類の比率——1:1、2:3、3:2、3:4、4:3、9:16、16:9——から 1 つを選び、6 クレジットを使って生成します。
画像は約 30 秒で完成します。作品は OVOV アカウントの「マイ作品」に自動保存されるので、いつでも戻ってダウンロードできます。
プロンプトだけで動く高速なモデルは、手元の画像を直すのではなく、ゼロから新しいビジュアルが欲しい場面でこそ真価を発揮します。
フィード画像、チャンネルアート、キャンペーンバナーを、キャプションからそのまま描き出します——撮影もストック素材のライセンスもアップロードの手間も不要です。
画面いっぱいの縦長シーンと、正方形のキャラクターポートレート——スマホとプロフィールが実際に使う 2 つの形です。
方向性を決める前に探ります。同じアイデアのバリエーションを撃ち込み、生き残ったフレームだけを残しましょう。
記事のヘッダー、セクションの区切り、ニュースレターのイラストを、テンプレートが求める形で必要なときに描画します。
このモデルが受け取る入力はプロンプトだけ。被写体もスタイルも光もフレーミングも、すべて一文が背負うことになります。
それ一つで完結する、ディテール豊富なプロンプトが最適
Grok Imagine 2.0 は最初に読んだものを軸に構図を組み立てます。被写体を名指しし、動作を与え、それから場所に置きましょう。
例
"A weathered lighthouse keeper hauling rope on a storm-lashed pier, freighters blurred in the distance"
真似できる画像がない以上、視覚言語は言葉で明示するしかありません。使ってほしい画材と、フレームが属する時代を言い切りましょう。
例
"Rendered as a 1970s sci-fi paperback cover, grainy print texture, flat poster colors"
ムードの大半は光が作ります。どこから来る光か、硬いか柔らかいか、どの色が画面を支配すべきかを書きましょう。
例
"Lit by a single sodium streetlamp in fog, hard shadows, amber and deep blue only"
キャンバスは 7 種類の比率から選びます。プロンプトはその形に似合うショットを描写すべきです。広い風景は 16:9 か 3:2、単独の人物は 3:4 か 9:16 に。
例
"Wide 16:9 establishing shot of a canyon town at dawn, figures small in the frame"
微調整に使える画像入力はないので、改善はテキストの中で起こります。惜しかったプロンプトを残し、一節だけ変えてもう一度走らせましょう。
例
"Same canyon town at dawn, but overcast instead of clear, and shot from street level"