Token导航 LogoToken导航

腾讯混元图像3.5实测 对标GPT Image 2

更新时间 2026-09-27来源 沃垠AI正文 4500字阅读约 15分钟21 张图片

大家好,我是冷逸。

这几天,我刷到 OpenRouter 官方发布的一张图。他们用同一句提示词让 20 个图像模型分别生图,按实际计费一算,发现最贵和最便宜的模型,价格竟然差了 22 倍。

图片

22 倍!我第一反应是:那便宜的模型和贵的模型,效果到底差多少?

可惜官方并没有给到非常详尽的横评,如果大家感兴趣的话,可以空了安排一下。

不过,要论生图的性价比,那还得看国产。

最近,腾讯上线了混元图像3.5预览版(Hy Image3.5 preview),主打「画字更准」和「排版增强」,可达到 GPT Image 2 九成以上的效果,价格却只要七分之一。

图片

正好朋友最近搞了个咖啡新品牌「栖山咖啡」,我干脆给自己接了个活:用它做一整套开业物料。

中文排版能不能用、能不能反复改,干完这单自然有答案。

图片

一手测评

新模型刚刚上线,在腾讯自家的设计 Agent Miora 上,甚至还可以免费白嫖一波。

 该图片疑似使用了AI生成技术,请谨慎甄别图片

1)品牌初建:直出Logo与产品图

一个品牌要立起来,Logo 和产品图是绕不开的基建。所以我先尝试用 Hy Image3.5 preview 做了一套品牌资产。

提示词:

极简矢量 Logo 设计,2×2 网格展示同一品牌的四种构图变体,白色背景。品牌:虚构咖啡品牌「栖山咖啡」,山形图标 + 中文品牌名。

四格分别为:

左上:拱形排列——山形图标居中在上,中文「栖山咖啡」沿拱形排在图标下方;

右上:图标与字标左右并置——左侧山形图标,右侧横排「栖山咖啡」;

左下:纯文字版——只有中文「栖山咖啡」,字重粗壮,无图标;

右下:带副标题版——山形图标 +「栖山咖啡」+ 下方小字「秋日市集限定」。

焦糖棕单色,扁平矢量,线条干净,无渐变无阴影。全中文,中文不得错字、缺笔、变形。1:1 方形。

3:4 竖版商品实拍图。一袋牛皮纸咖啡豆袋立于浅灰色无缝背景前,袋身正面贴米白标签:上半部分是山形 logo 与中文「栖山咖啡」,下半部分是中文「秋日市集限定 · 中深烘焙」。旁边一只白色陶瓷咖啡杯,杯身烫印同样的山形 logo 与「栖山咖啡」。商业棚拍质感,柔和顶光,纸张纹理与陶瓷釉面反光真实,85mm 镜头。避免塑料感、错误反射、明显 CGI 感。

图片
 该图片使用了AI生成技术图片

可以看出来,这次混元的新模型在对细节的理解和把控上相当稳。

给到我的 LOGO 比我想象的有设计感,不是烂大街的随便敷衍两笔。

但光有基础包装不够,我又追加了一组专业的微距咖啡豆细节图。

提示词:

咖啡豆与陶瓷咖啡杯微距摄影:几颗烘焙咖啡豆散落在牛皮纸咖啡豆袋开口处,100mm 微距镜头,突出咖啡豆的油脂光泽、表面纹理、豆袋纸张纤维与麻绳捆扎细节,杯身釉面反光与细微使用痕迹。商业棚拍质感,柔和侧光,浅景深,RAW 照片质感,焦糖棕与米白色调。避免塑料感、错误反射、畸形结构及明显 CGI 感。3:4 竖版。

 该图片使用了AI生成技术图片

咖啡豆微距(Hy Image3.5 preview)

图片

咖啡豆微距(GPT Image 2)

这张图,我分别用两个不同的模型都跑了一次。

Hy Image3.5 preview 的表现让我非常惊喜——不仅豆子的油脂、袋口的纸纤维、麻绳上的细节表现得淋漓尽致,连杯沿那点釉面反光都极其逼真。

我是真没看出来任何“AI 味”,甚至带了不少专业摄影师的布光风范。 

不过对于“散落在开口处”这几个字,两个模型的理解不太一样。

大家可以评论区留言看看,你更喜欢哪一种?

2)产品图背景随意换:电商主图的生死线

海报做得再好,真实世界的活儿往往不会这么一路顺下来。我紧接着甩了一个常见难题:“手上只有一张产品图,能不能直接丝滑换背景出图?”

打底图,用的是刚刚的商品参考图。接下来,两个场景共用一段锁定描述,只换背景:

提示词:

场景1·咖啡馆吧台:

严格保留参考图中的白色陶瓷咖啡杯与牛皮纸咖啡豆袋不变:杯形、袋形、山形 logo、杯身烫印「栖山咖啡」、袋身中文标签「秋日市集限定 · 中深烘焙」,一字不错、一处不动。只更换场景:独立咖啡馆的木质吧台上,暖色吊灯照明,背景虚化出手冲吧台和咖啡师剪影,杯中有刚倒好的拿铁。写实摄影,85mm 镜头质感,保留材质真实纹理,避免塑料感、错误反射、明显 CGI 感。3:4 竖版。

场景2·居家晨光:

严格保留参考图中的白色陶瓷咖啡杯与牛皮纸咖啡豆袋不变:杯形、袋形、山形 logo、杯身烫印「栖山咖啡」、袋身中文标签「秋日市集限定 · 中深烘焙」,一字不错、一处不动。只更换场景:居家窗边的原木小桌上,清晨柔和的斜射光,旁边有一本翻开的书和一小盆绿植,窗外虚化成暖色光斑。写实摄影,50mm 镜头质感,保留材质真实纹理,避免塑料感、错误反射、明显 CGI 感。3:4 竖版。

图片

结果极其惊喜。结构、包装上的中文、Logo 都保持的很稳定,甚至连纸袋子上面那个不起眼的「S」包装小字,都被完好无损地保留了下来。

不仅杯袋光影自然融入了新环境,不同光线下投射在不同台面上的阴影也模拟的很自然。

3)多约束海报直出:改字修图一条龙

搞定了产品,接着来做宣传海报。

如果不知道怎么写提示词也没关系,Hy Image3.5 preview 自带了一个非常贴心的功能:一键扩写提示词。

图片

提示词:

请为这个咖啡品牌设计一张中文商业宣传海报,画面需体现品牌调性与产品特色。具体要求:整体风格温暖高级,色调以深棕、奶白与焦糖色为主,可加入咖啡豆、蒸汽、拿铁拉花等元素;构图采用主体居中或三分法布局,突出品牌 Logo 与核心视觉焦点;光线柔和自然,营造手冲咖啡的质感与氛围;画面上方或中央配置简洁有力的中文主标语与副标题,字体选用现代无衬线或书法体以适配品牌气质;预留产品名称与价格信息的位置。整体呈现出精致、有格调的商业广告效果。

第一版出图后,如果里面的细节文字不是特别满意,还可以直接在 Hy Image3.5 preview 里选择「文字替换」,修改对应的文字重新生成。

图片
图片
图片

当然,也可以直接用自然语言去修改替换对应的画面。

整个修图过程,相当丝滑,除了要改的地方,其他一点没崩。

也算是真正实现“指哪打哪”了。

4)信息图:一张图塞进一本说明书

还记得当初让 GPT Image 2 一战成名的一个检验标准,就是中文高密度信息图。

所以这次,我干脆也来挑战一下 Hy Image3.5 preview 的能力边界,让他生成了一页「手冲咖啡指南」。

提示词:

请生成一张高密度信息图风格的说明书,主题为「手冲咖啡指南」。要求:整体采用信息图(infographic)版式,信息层级清晰、图文密集而不杂乱;包含手冲咖啡的关键要素,如所需器具清单、咖啡豆与水的推荐比例、水温范围、研磨度、注水与闷蒸步骤流程、总萃取时间,以及常见风味影响因素。视觉风格简洁现代,配色以咖啡棕、米白、深灰为主,搭配少量强调色;使用图标、数据标注、分步骤编号与流程箭头增强可读性。版式适合竖版长图海报,文字为中文,标题醒目,重点数据突出显示。

图片

手冲咖啡指南(Hy Image3.5 preview)

图片

手冲咖啡指南(GPT Image 2)

事实证明,两个模型的表现都很不错,即使在复杂排版下,也没有出现文字变形或乱码的情况。 

图片

我甚至单独放大了 Hy Image3.5 preview 的小字细节,竟然也非常清晰准确,确实达到了 Image2 的九成功力。

这一步跨过去,这个模型在我这儿也算是真正的“能打”了。

5)换个画风做社媒海报

有了前面的资产,换个画风再发一轮社交平台,自然是水到渠成。

提示词:

请为「栖山咖啡」设计一张插画风格的秋日市集宣传海报。要求:整体采用温暖的手绘插画风,色调以秋日的橘棕、金黄、枫红与暖米色为主;画面可包含咖啡杯、落叶、南瓜、市集摊位、木质纹理等秋日元素,构图层次分明、留白舒适;搭配柔和光影与细腻的颗粒质感,营造温馨治愈、充满季节氛围的市集感;排版注重主标题与信息的清晰可读,融入品牌「栖山咖啡」的名称或标志,风格统一、富有手绘艺术气息。

图片

这一组图我依然是用了两个模型来对比,毕竟 GPT Image 2 在生图的创造力和审美上一直都出了名的优秀。

但 Hy Image3.5 preview 的表现这次同样让我惊喜,在手绘插画上体现出了该有的温暖颗粒感与细腻光影。

而事实证明,参考图有时候确实会很大程度的限制模型的想象力。

6)市集现场手机抓拍

再来看看 Hy Image3.5 preview 在写实场景下的表现,结果也相当不错。

我试了两组写实抓拍:一张是秋日市集的现场,一张是情绪氛围感的人像。

提示词:

用手机拍摄的秋日市集现场,傍晚,从人群中微微仰拍,画面略微倾斜。画面中央是「栖山咖啡」的市集摊位:木质餐车上方挂着一块发光的中文灯牌「栖山咖啡 · 秋日市集」,高亮发光字体在傍晚天色中微微溢出光晕;摊位前两三个人排队,手持纸杯。暖色串灯、枫叶装饰,背景是虚化的市集人群。

画面存在噪点、轻微模糊、HDR 不均衡,亮部灯牌略过曝,暗部有细节丢失,真实随手拍风格,iPhone 实拍质感。除灯牌外不出现其他可读文字,中文不得错字、缺笔。3:4 竖版。

 该图片使用了AI生成技术图片

模拟市集现场手机抓拍

提示词:

一张情绪氛围人像:夜晚的市集街道,年轻的中国女性侧身回头看向镜头,背景是收摊中的市集,暖色串灯和路灯形成光斑与动态模糊。复古色调,富士胶片相机风格,粗颗粒感,85mm 镜头,浅景深。避免过度磨皮、避免塑料感。3:4 竖版。

图片

收摊时的情绪片

第一张图里,过曝的光晕、噪点、色差都非常接近真实拍摄,镜头虚化得也很自然。

第二张图里,富士胶片的颗粒感、串灯拖出来的光斑、回头的那个角度,以及最考验 AI 的人手。都非常完美。

这种身临其境的烟火气,说是我亲自去现场拍的,你们估计都会信吧?

7)多参考修图

在修图这个场景,这次我也来了个猛的。 

我一次性喂了 5 张参考图:现场抓拍、商品图、情绪片、毛线材质、毛绒玩偶,尝试让模型理解后生成最终的融合图。

提示词:

把图2的咖啡杯和图4的毛绒枫叶玩偶合体之后,放在图1市集摊位的木质餐车上,卡通眼睛看着镜头。参考图3中串灯的样式外观,将暖色小灯零散地漂浮在图1画面各处,把图1的餐车墙面材质整体换成图5的针织毛线材质。整体呈现梦核的怪诞感觉,色调保持秋日暖棕。

图片

结果让人叹为观止:玩偶和咖啡杯成功合体上了餐车,玩偶长了双卡通眼睛盯着镜头;小灯散在画面各处,背景墙换成了针织毛线;而原来的灯牌和人群还在原位没动。

图片也按照参数自然调整为了 16:9 的横版。 

这么天马行空的修图逻辑被稳稳接住,多图融合能细致到这个程度,是我完全没料到的。

8)彩蛋:顺手做了个经营小游戏UI

最后,再来个彩蛋。趁着手热,我顺便尝试做了一款横版经营手游的界面。

提示词:

20:9 横屏治愈系模拟经营手游主界面截图。背景:秋日市集里的一间木质咖啡小店,暖色灯光,柜台后有手冲吧台,窗外飘枫叶。UI:左上椭圆等级「Lv.12」;左侧细线图标纵列「订单·菜单·仓库·店员」;右侧 24% 复古纸片菜单+一张票券「开店 OPEN」;底部渐暗区一行中文台词「今天的第一杯,要加一份秋天吗」。手绘质感、纸张纹理,焦糖棕、暖沙色、墨绿、象牙白配色,UI 克制不挡景。全中文(票券英文除外),中文不得错字、缺笔。避免写实照片感、避免杂乱图标。

 该图片使用了AI生成技术图片

满满的氛围感这不就来了?直接拿去当游戏 Demo 的概念宣发图都毫不违和。

文章标签腾讯
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多