AiFan 提示词盲盒固定栏目首图

AiFan 提示词盲盒 · 第 1 期

同一张照片、同一段提示词,分别交给 Image2、Nano Banana 和豆包。差距到底出现在哪里?

今天不讲复杂工作流。

我们只做一个简单但挺有意思的实验:

把同一张日常穿搭照,交给三款 AI,做成高级时尚杂志风的 OOTD 穿搭拆解海报。

原图里的穿搭很简单:白色短袖、浅蓝阔腿牛仔裤、白色运动鞋、奶油色帆布包和一条极简项链。

越是简单的素材,越考验模型能不能守住人物、读懂衣服,并把信息排得像一本真正的杂志。

这次用的提示词

基于用户上传的人物穿搭照片,生成一张高级奢侈品杂志风 OOTD 穿搭拆解海报。保留主体人物的姿态、服装结构、配饰和整体气质,去除杂乱背景,置于暖白、象牙白或浅米色高级背景中。

画面为竖版 4:5 或 2:3。左侧展示人物全身,右侧设置 4 到 6 个穿搭拆解模块。每个模块包含编号、中文品类名、英文品类名、局部放大图、材质纹理小图和 2 到 3 行时装编辑式说明。使用细金线或浅灰金线连接人物关键单品与对应模块,加入圆形放大镜效果。

标题为 OOTD / 穿搭拆解 / OUTFIT ANALYSIS。底部加入 COLOR PALETTE 和 STYLE KEYWORDS。整体参考高端时尚杂志、奢侈品 lookbook 和精品服装工艺解析页。不要添加真实品牌 Logo,不要做成电商详情页,不要价格标签、二维码和杂乱背景,不要改变主体穿搭,不要让文字乱码。

本次输入原图

这张照片是三款模型共同使用的参考图。

后面的结果,可以重点看人物是否自然、原有穿搭有没有被改动,以及模型是否凭空增加了原图中不存在的细节。

三款模型共同使用的人物穿搭原图

▲ 本次图生图任务的输入原图

第一张:Image2

Image2 生成结果

▲ Image2 生成

这一张的优势,是完成度最高

五个拆解模块都对应了真实穿搭,中文和英文基本准确,配色方案、风格关键词、放大细节和连接线也都交代完整。

更重要的是,它没有擅自给人物换衣服,也没有凭空增加品牌和装饰。

如果把“能否直接进入下一步编辑”作为标准,这一张最省事。

我的判断:结构、文字、细节和提示词遵循度最均衡,适合作为本次第一名。

第二张:Nano Banana

Nano Banana 生成结果

▲ Nano Banana 生成

Nano Banana 的画面很干净,人物保留自然,整体很像一本轻奢生活方式杂志。

它对领口、面料、牛仔、包袋、鞋履和整体气质做了六项拆解,阅读节奏也很顺。

不过,它没有完全按照原提示词指定的五个品类组织内容,还自行增加了包袋挂饰细节。部分说明文字也有轻微异常。

所以这张视觉气质很好,但任务遵循度略逊一筹

我的判断:人物自然、版面清爽,适合看视觉;综合准确度排第二。

第三张:豆包

豆包生成结果

▲ 豆包生成

豆包抓到了暖白、浅金、杂志拆解页这些视觉关键词,第一眼的氛围并不差。

但放大看,问题也最明显:中文说明出现乱码,英文失真,编号从 3 跳到 6,还凭空增加了刺绣、纽扣、手提包等原图没有的元素。

它做出了“像杂志的样子”,却没有稳定守住“这身穿搭本来是什么”。

我的判断:大方向对了,但细节可信度和文字可用性不足,本次排第三。

最后排名

第 1 名:Image2 最完整,文字和服装对应最准确。

第 2 名:Nano Banana 人物自然,杂志感强,细节有少量偏移。

第 3 名:豆包 氛围合格,但乱码和虚构细节影响使用。

这次让我印象最深的,不是谁的画面最“炸”。

而是做信息型图片时,真正决定可用性的,往往是三件小事:

文字能不能读、细节有没有乱编、要求有没有执行完整。

图片漂亮,只是第一关。

如果还要拿去发公众号、做方案或交给客户,准确和省返工,可能更值钱。

你更喜欢哪一张?

只看第一眼,你可能会有不同答案。

但如果要从三张里选一张直接继续编辑,我会选 Image2。

下一期,我们再换一条提示词,继续让它们同题作答。

-晚安,么么咪⊙⊙-

AiFan Lab出品

你造吗?

我只是,

对这个世界充满了好奇。

分裂时间

“高级感不是加得更多,而是每一个细节都没有说错。”

—— AiFan