xAI 的圖像模型,現已登陸 OVOV。寫下提示詞,從 7 種比例中挑一種,約 30 秒拿到成品——只有一個畫質檔,沒有參數可調,每張 6 點數。
各模型名稱與標識均為其各自所有者的商標。OVOV 為獨立產品,與任何模型提供方均無隸屬、背書或贊助關係。
全部都是 OVOV 上 Grok Imagine 2.0 的真實輸出,僅由文字提示詞生成——不挑圖、不後製。

Photorealistic street photograph of an overloaded municipal sign pole on a quiet residential corner,...

A photo taken on a cheap digital camera in the summer of 2004 at a suburban backyard barbecue. Shot ...

High-fashion magazine cover, extreme close-up of an avant-garde metallic sculpture instead of a mode...

Realistic photograph of a full-size passenger train running along the crest of an ocean wave, spray ...

A professionally shot photorealistic diagram of four regional dumplings on a white background, each ...

A screenshot from a fictional 16-bit turn-based RPG battle scene, pixel art, limited palette. The bo...

A vintage 1970s disaster-movie poster, offset-printed on slightly yellowed stock. Painted illustrati...

A cliffside monastery carved directly into black basalt, seen from across a fjord in the minutes bef...

A character reference sheet for a stop-motion film, laid out on grey card. One fox character in felt...
xAI 的圖像模型刻意做得很窄:文字進,一張圖出。不能上傳圖片,沒有參數旋鈕,也不用乾等——一句提示詞,一張成品。
Grok Imagine 2.0 帶著 xAI 訓練出來的家族風格——高對比、篤定的色彩,以及對超現實的偏好。它讀提示詞是帶著態度的,而不是把它平均成一張安全的圖庫照。
提示詞進,圖片出。Grok Imagine 2.0 是純文字生圖模型——它不接受上傳圖片,也無法對既有的圖做重繪或修圖。每一張都只由你的文字生成。
一次生成大約半分鐘完成,所以改一句話再跑一次是流程的常態,而不是一次喝咖啡的等待。
可選 1:1、2:3、3:2、3:4、4:3、9:16 或 16:9——方形做頭像,直式適配手機螢幕與限時動態,橫式用於橫幅與頁首。
沒有多檔解析度需要權衡。Grok Imagine 2.0 只在一個固定畫質檔下算圖,你選的比例決定畫面的形狀。
每次生成消耗 6 點數、回傳 1 張圖——不論選哪種比例,價格都一樣。若生成失敗,點數會原路退回你的餘額。
不用上傳,也沒有參數要設定——整個流程就是:寫、選形狀、下載。
描述主體、場景和質感。既然沒有參考圖可用,你想要的每一個細節都必須寫進這句話裡。
從 7 種比例中挑一個——1:1、2:3、3:2、3:4、4:3、9:16 或 16:9——然後花 6 點數生成。
約 30 秒後圖片就緒。作品會自動存進你 OVOV 帳號的「我的作品」,隨時都能回來查看與下載。
一個只吃提示詞的快模型,最適合從零開始要一張新圖的場景,而不是修改一張你手上已經有的圖。
動態消息配圖、頻道主視覺、活動橫幅,直接從一句文案生成——不用拍攝,不用買圖庫授權,也沒有上傳這一步。
鋪滿螢幕的直式場景與方形角色肖像——手機和個人檔案真正會用到的兩種形狀。
在定方向之前先探路。圍繞同一個想法連出幾版,留下活下來的那幾張。
文章主圖、段落分隔圖、電子報插圖,按你的版型需要的形狀隨取隨生成。
提示詞是這個模型唯一的輸入,所以主體、風格、光線和取景都得靠它自己扛。
最適合自成一體、細節充分的提示詞
Grok Imagine 2.0 會把構圖錨定在它最先讀到的東西上。先點名主體,給它一個動作,再把它放進某個場景。
範例
"A weathered lighthouse keeper hauling rope on a storm-lashed pier, freighters blurred in the distance"
沒有圖可以照著抄,視覺語言就必須寫明白。說清楚你要的媒材,以及畫面屬於哪個年代。
範例
"Rendered as a 1970s sci-fi paperback cover, grainy print texture, flat poster colors"
氛圍大半是光決定的。說清楚光從哪裡來、是硬是柔,以及畫面該由哪些顏色主導。
範例
"Lit by a single sodium streetlamp in fog, hard shadows, amber and deep blue only"
畫布由你從 7 種比例中挑;提示詞就該描述一個配得上它的鏡頭。開闊場景歸 16:9 或 3:2,單人畫面歸 3:4 或 9:16。
範例
"Wide 16:9 establishing shot of a canyon town at dawn, figures small in the frame"
沒有圖片輸入可以微調,打磨只能發生在文字裡。留住那條差一點就對的提示詞,改動其中一個子句,再跑一次。
範例
"Same canyon town at dawn, but overcast instead of clear, and shot from street level"