xAI 的图像模型,现已上线 OVOV。写下提示词,从 7 种宽高比里挑一种,约 30 秒拿到成品——只有一个画质档,没有参数可调,每张 6 积分。
各模型名称与标识均为其各自所有者的商标。OVOV 为独立产品,与任何模型提供方均无隶属、背书或赞助关系。
全部为 OVOV 上 Grok Imagine 2.0 的真实输出,仅由文字提示词生成——不挑图、不后期。

Photorealistic street photograph of an overloaded municipal sign pole on a quiet residential corner,...

A photo taken on a cheap digital camera in the summer of 2004 at a suburban backyard barbecue. Shot ...

High-fashion magazine cover, extreme close-up of an avant-garde metallic sculpture instead of a mode...

Realistic photograph of a full-size passenger train running along the crest of an ocean wave, spray ...

A professionally shot photorealistic diagram of four regional dumplings on a white background, each ...

A screenshot from a fictional 16-bit turn-based RPG battle scene, pixel art, limited palette. The bo...

A vintage 1970s disaster-movie poster, offset-printed on slightly yellowed stock. Painted illustrati...

A cliffside monastery carved directly into black basalt, seen from across a fjord in the minutes bef...

A character reference sheet for a stop-motion film, laid out on grey card. One fox character in felt...
xAI 的图像模型刻意做得很窄:文字进,一张图出。不能上传图片,没有参数旋钮,也不用干等——一句提示词,一张成片。
Grok Imagine 2.0 带着 xAI 训练出来的家族风格——高对比、笃定的色彩,以及对超现实的偏好。它读提示词是带态度的,而不是把它平均成一张安全的图库图。
提示词进,图片出。Grok Imagine 2.0 是纯文生图模型——它不接受上传图片,也无法对已有的图做重绘或修图。每一帧都只由你的文字生成。
一次生成大约半分钟落地,所以改一句话再来一次是流程的常态,而不是一次喝咖啡的等待。
可选 1:1、2:3、3:2、3:4、4:3、9:16 或 16:9——方图做头像,竖图适配手机屏与快拍,横图用于横幅与页头。
没有多档分辨率需要权衡。Grok Imagine 2.0 只在一个固定画质档下渲染,你选的宽高比决定画面的形状。
每次生成消耗 6 积分、返回 1 张图——无论选哪种比例,价格都一样。若生成失败,积分会原路退回你的余额。
无需上传,也没有参数要配——整个流程就是:写、选形状、下载。
描述主体、场景和质感。既然没有参考图可用,你想要的每一个细节都必须写进这句话里。
从 7 种比例里选一个——1:1、2:3、3:2、3:4、4:3、9:16 或 16:9——然后花 6 积分生成。
约 30 秒后图片就绪。作品会自动存入你 OVOV 账号的「我的作品」,随时都能回来查看和下载。
一个只吃提示词的快模型,最适合从零开始要一张新图的场景,而不是修改一张你已经有的图。
信息流配图、频道头图、活动横幅,直接从一句文案生成——不用拍摄,不用买图库授权,也没有上传这一步。
铺满屏幕的竖版场景与方形角色肖像——手机和头像真正会用到的两种形状。
在定方向之前先探路。围绕同一个想法连出几版,留下活下来的那几帧。
文章头图、章节分隔图、邮件通讯插图,按你的模板需要的形状随取随生成。
提示词是这个模型唯一的输入,所以主体、风格、光线和取景都得靠它自己扛。
最适合自成一体、细节充分的提示词
Grok Imagine 2.0 会把构图锚定在它最先读到的东西上。先点名主体,给它一个动作,再把它放进某个场景。
示例
"A weathered lighthouse keeper hauling rope on a storm-lashed pier, freighters blurred in the distance"
没有图可以照着抄,视觉语言就必须写明白。说清楚你要的媒介,以及画面属于哪个年代。
示例
"Rendered as a 1970s sci-fi paperback cover, grainy print texture, flat poster colors"
氛围大半是光决定的。说清楚光从哪儿来、是硬是软,以及画面该由哪些颜色主导。
示例
"Lit by a single sodium streetlamp in fog, hard shadows, amber and deep blue only"
画布由你从 7 种比例里挑;提示词就该描述一个配得上它的镜头。开阔场景归 16:9 或 3:2,单人画面归 3:4 或 9:16。
示例
"Wide 16:9 establishing shot of a canyon town at dawn, figures small in the frame"
没有图片输入可以微调,打磨只能发生在文字里。留住那条差一点就对的提示词,改动其中一个从句,再跑一次。
示例
"Same canyon town at dawn, but overcast instead of clear, and shot from street level"