GPT Image 2 中文文字总是畸形乱码:能力边界在哪,3 种绕法怎么选
“文生图模型会写字”这件事,从一开始就是个误会。
2021 年前后那批文生图模型放出来的时候,圈里传得最凶的是一批”招牌图”:招牌上、书脊上、T 恤上全是”像字但不是字”的东西——连英文字母都拼不齐,更别说汉字。当时没人把这当 bug:大家默认它本来就不该会写字,字形对它来说和树叶纹理、砖墙缝隙同属一类,都是局部纹理。
五年过去,英文短词大致能出对了。中文这条线,还卡在半路上。
这篇把路线图画清楚:它从哪来、现在停在哪一站、下一站多远,以及站在 2026 年 7 月这个位置上,你手里那张中文全是鬼画符的图该怎么办。
先交代一件跟本文有关的事:讲演进的文章最该配一张时间线信息图,我没做。那张图得在图里渲染一堆中文年份和里程碑名——让模型去画一张全是中文的图,来给”模型画不好中文”这个论点当插图,当场自打脸。这个取舍本身,就是全文结论的预演。
模型不是在”排”字,是在”画”字
图注:左边是画的,右边留给排版
你在 Photoshop 里打一个”燚”字,屏幕上出现的那个字形,是从字体文件里取出来的一段矢量轮廓:排版引擎按字号缩放、按基线对齐,再画到画布上。字形是查出来的——字体文件里那个字长什么样,它就长什么样,一笔一画都不会走样。
文生图模型手里,看不出有这样一张表。
这里得先声明一句:OpenAI 没有公开 GPT Image 2 的具体架构。 下面是一种可能的解释,依据的是这一类模型的公开研究——DDPM(2020)给出的是”从高斯噪声一步步去噪、生成图像”的过程;Latent Diffusion(2022,Stable Diffusion 的底子)把去噪搬进潜空间、再解码回像素,并用 cross-attention 接收文本条件。这些论文里找不到一条”按字形逐笔监督”的通路。按这个视角看,图里那个像”燚”的东西,是模型根据训练时见过的无数张”图上有字”的照片,在那个位置涌现出来的一片像素——像不像字,取决于它对”这块地方该长什么纹理”的先验。
这套机制能不能反推到 GPT Image 2 身上?不能。所以下面这段更要紧——你不需要知道它内部是什么,看行为就够了:同一段 prompt 什么都不改,连着跑四次,那块招牌上的字每次都不一样。(图叮的生图页没有 seed 输入框,每次都是重抽。)排版引擎不会这样:它不会随机发明笔画,你打什么字它就取什么字形,同样的输入永远同一份轮廓。所以不管底下是什么,结论都一样:这条链路吐出来的字形是不稳定的,不能当成”取”出来的东西去验收。
这也是为什么 prompt 改一遍又一遍也白搭:你能约束风格和布局,却按不住字形。这条天花板留到绕法三再拆。
汉字这道坎,有几个能自己查的数字
同样是画不好字,为什么英文先被解决、中文还悬着?有几个数字公开可查,你自己就能核。
先看字符集的量级差。Unicode 的 CJK 统一表意文字基本区(U+4E00–U+9FFF)有 20992 个码位;中国 2013 年发布的《通用规范汉字表》收 8105 个字,其中日常够用的一级字表是 3500 个。拉丁那边呢——26 个字母算上大小写共 52 个,加 10 个阿拉伯数字,62 个。
这不是”多了一点”,是两个数量级。而且汉字不是原子符号,是偏旁部首的二维拼装:左右、上下、包围结构;同一个”氵”在不同字里宽窄不同、落点不同。要在像素空间里稳定还原这几千个结构,和还原 62 个字母不在一个层级上。
再叠一层:这几千个字形在训练数据里的频次极不均衡——“的""是""了”被见到的次数,和”燚""龘”完全不是一回事。低频字画出来什么样,你可以自己想。
所以这是能力结构层面的事,不是你 prompt 写得不够好。
一张路线图:从”连英文都拼不对”到”英文能出、中文悬着”
文本渲染这条线,按公开论文和官方技术报告的时间顺序,几个站点大概是这样。
2022 年 5 月,Imagen(Google)。 论文第一次把”文本编码器怎么选”摆上台面:拿一个冻结的大型语言模型(T5-XXL)当文本编码器,比图文对比学习出来的编码器更能理解复杂描述;而且把文本编码器做大,收益比把图像那侧做大更明显。文字渲染从此成了一个可优化的维度,不是天生的残疾。
2022 年 11 月,eDiff-I(NVIDIA)。 同时挂 T5 和 CLIP 两个文本编码器,论文专门展示了拼写能力的改善。方向被坐实:想让模型画对字,先让它”读懂”字。
2023 年 4 月,DeepFloyd IF 公开发布(研究许可,不是完全开源)。走 T5-XXL 路线的像素级级联扩散模型,普通人也能在一个下得到的模型上稳定拿到可读的英文短词。
2023 年下半年,DALL·E 3 与 SDXL 这一代。 英文短词的可读性变成商业模型的卖点。中文呢?还是鬼画符。割裂第一次变得刺眼:同一个模型,英文能出 SALE,中文出不了”促销”。
2023 到 2024 年,专治”图里的字”的方法成型。 GlyphControl、AnyText(阿里,ICLR 2024)走的是字形条件注入:先用真正的字体文件把字渲染成一张字形图,再把这张图当额外条件塞进模型,模型只负责把它融进画面的光影和材质,不负责发明字形;AnyText 明确支持中文。Glyph-ByT5(微软)换了个入口——用字形与文本配对的数据去微调一个字符级文本编码器,再接进 SDXL。路子不同,冲的是同一个问题:别让模型自己瞎猜字长什么样。
这批工作存在本身,就是一次坦白——指望模型凭空学会写汉字,这条路被绕开了。
2024 年,Stable Diffusion 3。 三个文本编码器并联(两个 CLIP 加一个 T5-XXL),官方技术报告把拼写能力列为主要改进项之一。仍然是英文。
2025 到 2026 年,GPT Image 2 这一代。 走到今天:英文短词和阿拉伯数字大体能用;大字号、少字数的中文要看运气;小字号、密集排版的中文,别想。这个判断的来路得说清楚:OpenAI 没公布分语言的逐字准确率,它是跑图跑出来的经验,不是官方指标——下一节给你一套自检方法,你自己就能复现。图叮之前那篇 GPT Image 2 高清出图的 5 类翻车 把”文字”单列了一类,结论也是同一句话:图内中文默认走”AI 留白 + 后期贴字”,别赌模型。
路线图画到这儿,有件事很明显了:这几年真正被解决的是英文。中文一直坐在候机厅里,广播喊的一直是别的航班。
什么时候能赌一把,什么时候直接别想
“别想”这话太糊。但我不会给你一组”字数不超过 N、字高不低于 M%“的阈值——那种数字看着精确,其实没有公开实验或官方文档撑着,是把猜测包装成标准。给三样更硬的:一条数学、一条物理直觉、一套你自己就能跑的自检。
数学:字数是指数,不是加法。 一个简化模型——假设各个字画对与否互相独立、单字正确率都是 p(p 小于 1),那么 n 个字全对的概率就是 p 的 n 次方:每多一个字,成功率是乘下去的。真实情况里错误未必独立、每个字的 p 也不一样,所以这不是一个能拿去算准确率的公式;它只说明方向:每多一个必须正确的字,整串全对只会更难。反过来,这也给出了最有效的降难度手段:能砍字就砍字。
物理直觉:像素不够,笔画就黏。 一个二十多画的汉字和一个英文字母,缩到同一个字高时,汉字的笔画间距要小得多。而像素有下限——相邻两笔之间的空隙不足一个像素,采样和压缩之后就会连成一坨墨。这跟模型好坏无关,是显示和印刷的老问题:同一个字号下,宋体的横细到一定程度在屏幕上就会消失,同一个道理。所以同样的画面、同样的字高,先糊的是汉字。至于具体糊在哪个字号,还受字体、抗锯齿、导出格式和压缩影响——别去套什么统一阈值,在最终尺寸下逐字看才算数。
图注:字号一小,笔画先黏死
自检:出图后自己跑三步。
- 导出后放到 100% 视图(别用”适应屏幕”,那会二次糊化),把每个字念一遍。念不出来,或者是错字、偏旁装错位置——翻车,不用看第二眼。
- 同一段 prompt、其余参数不动,只换种子,连出三四张,只盯那块文字。每张都不一样,说明这个位置的字形不稳定,你是在赌博。
- 把同一个位置的中文换成英文短词,再跑一遍,对比可读性。英文字母加阿拉伯数字只有 62 个、字形也简单得多,稳定性明显高一档——画面只是需要”有点字的感觉”时,换英文是一次几乎不花钱的降难度。
结构上就没戏的场合(不用试,直接走绕法一):
- 需要逐字正确的文字:包装合规文案、成分表、批号、规格参数、价格旁的单位、法务声明。错一个字的代价,不是重出一张图能兜住的。
- 密集排版:一整段话、一张列表、一份菜单。字数一多,上面那个指数就把你摁死了。
- 小字号:二维码旁边那行小字、瓶身背面的说明。像素本来就不够摆笔画。
- 竖排、艺术变形字体、精确的品牌 logo 字样;品牌名带生僻字的也一样,低频字模型见得少。
可以赌一把的场合:字少、字大、都是常用字,而且错了也不致命——背景里虚化的街边招牌、远处的书脊,观众根本不会去念,糊了也没人发现。
三种绕法,按推荐度排
绕法一:出图留白,后期用真正的排版工具把字加上去
这是正解。原因很单纯:它把”画字”这个概率性的动作,换成了”排字”这个确定性的动作。
第一步,在 prompt 里显式要求文字位置留白。不是写”文字要清晰”,而是写”文字位置留空”:
产品包装上的文字位置全部留白,不出现任何字符;
海报中央预留一块干净的浅色区域,用于后期添加标题;
品牌 logo 位置留空,由后期单独贴回。
图注:字留到后期再排
顺手把 prompt 里的品牌名、商品名、广告语全删掉——模型看到这些词会试着把它们写进画面,等于你亲手埋了个翻车点。商品用品类词描述就够(写”红色精华液瓶”,别写”XX 牌红色精华液”)。具体写法见 GPT Image 2 的 prompt 写作模式。
第二步,把字加上去。用什么工具都行——Photoshop、Figma、任何一个能排版的编辑器,共同点只有一个:字形来自字体文件,不是模型现画的。
图叮的给图片加文字干的就是这件事,纯前端:图片不上传服务器,全程在你自己浏览器里跑完,注册后免费、不限次数。
几个别人踩过的坑,它默认帮你躲开了:
- 白字压在浅色背景上会直接消失。 多数在线加字工具默认不描边,你在小预览框里看着挺好,导出到原图才发现字糊进了天空。它默认带描边(白字配深色边、黑字配白色边),底图什么颜色都分得出字的轮廓。
- 字号按预览尺寸算,导出后字变指甲盖。 预览是降采样过的:48px 在预览里看着正好,落到 4000px 宽的原图上小得可怜。正确做法是把字号和位置存成相对图片宽度的比例,绘制时按实际尺寸现算——顺带的好处是,给一批宽高各异的图打同一段文案,文字会落在同一个相对位置上。
这条路径的代价是多一道工序。可那道工序是确定性的、可批量的、不花钱的;而重生成是概率性的、每次都扣积分。
绕法二:图生图局部重绘,只重画文字那一块
底图很贵的时候用这个:那张构图你迭代了好多次才满意,光影材质全对,就招牌上那几个字是鬼画符——重做整张,风险是构图跟着一起变。做法是框选文字区域做局部重绘(inpainting),只让模型重画这一小块。它比整张重生成好一点,原因不神秘:画布小了,模型的注意力被约束在这块地方,不用同时操心商品、背景、光影。
但那块地方干的仍然是”画字”,不是”排字”,上一节那些判断照样适用:字少、字大、常用字,你可能撞对;成分表那种密集小字,重绘多少次也还是那样。
所以给自己定个上限:试几次,不对就退回绕法一,把那块抠成留白,后期贴字。上限定几次不重要,重要的是有上限——“再试一次说不定就好了”是赌徒心态,而积分是真金白银。
绕法三:prompt 硬调(它的天花板在哪,你得知道)
排第三,是因为它的天花板明摆着:prompt 是条件信号,能影响”有没有字""什么风格""什么颜色”,但按不住字形。你写”避免乱码""确保汉字正确”,这些词不会变成任何字形层面的约束——模型本来就在尽力把那块画得像字了。
prompt 真正能做的是降低难度,不是提高精度:减字数、加大字号(在 prompt 里写成”占据画面上方三分之一的大标题”)、换成英文或数字、要求留白。你会发现这四件事里的第四件,已经通向绕法一了。
所以 prompt 硬调算不上一种独立解法,它是”降低难度”的手段集合。真想要精度,得换路径——把字形从模型手里拿走。
我们停在路线图的哪一站
截至 2026-07,这条路线图的当前位置是:英文的问题基本解决了;中文的问题被绕开了,但没被解决。
往前看一站,最有希望的还是那批”专治图里的字”的方法——如果被主流商用模型吸收,中文渲染大概会有一次台阶式提升,而不是一点点挪。但留意 AnyText 这条路线的关键一步:字形是用字体文件先渲染好、再喂给模型当条件的,不是模型凭空发明的——等于把一个排版环节搬进了生成流程。
也就是说,哪怕将来某一代模型”能画对中文”了,它底下干的事,和你今天手动做的”AI 出留白底图 + 后期排版加字”很可能是同一件事——只不过那道工序被搬进了模型内部。你现在手动走的这条路不是权宜之计,只是暂时还得你自己走一遍。
所以站在 2026 年 7 月这个登机口回头看:这几年行业花大力气教模型写字,兜一圈的结论是别教了,把字递给它。你没必要陪着再走一遍弯路。出图时留白,加字时用浏览器里的排版工具——你打什么字它就取什么字形,一分钱都不用花。省下来的积分,留给模型真正擅长的:光影、材质、构图。
图叮工具中心把几类列在一起,界线得分清:纯本地那档(加文字、格式转换、看 EXIF)在你浏览器里跑,不上传、注册后免费、不限次数;网页生图按张计费,各买各的积分包,两个包不通用,会员卡也用不上;PS 插件那档注册送 50 张试用,订阅后无限生成。说到底就一句话:能在浏览器里确定性完成的事,别丢给一个概率性的模型去赌——尤其当那次赌注要花钱。
需要 AI 的步骤,可用图叮AI 的网页工具按张处理
Image-2 生图和 Nano Banana 改图都在网页里使用;两边积分包不通用,各自按张扣积分,注册不送试用张数。
相关文章
软装汇报怎么快速换材质?图生图一键替换窗帘地毯
软装方案汇报时客户总想看不同材质效果,重新渲染太慢。这篇讲如何用图生图技术一键替换窗帘地毯材质,从选区、提示词到重绘幅度逐一拆解,提升汇报成功率。
AI 图生图把证件照重绘成形象照总不自然?参数与提示词怎么调
用 AI 图生图把模特证件照重绘成商业形象照,常出现换脸、塑料感、光影割裂?本文拆解重绘幅度、蒙版羽化、提示词与 ControlNet 的具体调法,给出能直接照抄的参数区间。
免费AI产品生图工具实测:广告策划如何攻克玻璃器皿复杂边缘与透光难题
深度实测免费AI产品生图工具在玻璃器皿生图中的表现。提供从垫图、提示词到图叮AI局部重绘的具体可操作步骤,解决复杂边缘透光痛点,助力广告策划高效产出商业大片。
家常菜照片怎么修得有食欲:5步把暗黄的菜修到想夹一筷子
家常菜拍出来常常暗黄没胃口,油光发灰、菜色发蔫。这篇按5步讲怎么用图叮AI的自定义打光和材质高清修复,把家常菜照片从暗淡修到让人想夹一筷子,先点亮再补质感、清掉盘边杂物、最后校色,也说清修图只是美化呈现、别修得跟实物差太远。
推荐阅读
拖车绳商品图交给外包前:金属钩、织带和承重标怎么标注
拖车绳套装图不能只修得更亮。本文用 FAQ 方式拆解外包标注、图叮清理边界、金属钩保护、织带纹路、承重标和收纳袋复核方法。
案例拆解室:一组登山背包详情页,图叮如何拆肩带、扣具、容量和防水涂层证据
登山背包详情页不能只修得硬朗。肩带缝线、胸扣腰扣、容量比例和防水涂层都在证明商品承诺,图叮修图前要先把这些区域拆出来。
用 AI 写真生成情侣穿搭 Look:单人也能拍出情侣感 | 图叮AI
情侣同框拍写真门槛不低。这篇讲清楚 AI 写真生成情侣穿搭 Look 的原理与边界,附情侣装色彩呼应、款式协调的实用搭配方法,以及上传照片时怎么拍效果更好,帮你单人也能产出有情侣感的视觉内容。
手机取卡针套装图怎么拆:针尖、卡托和收纳卡别被 AI 修假
取卡针套装图不只是几根金属针。本文按针尖、卡托示意、收纳卡、兼容机型和数量关系拆解,说明哪些可清理、哪些要保护,避免修图后引发配件错发和售后误会。
更多推荐(8 篇)
美妆玻璃瓶高光怎么修:别把高级感修成塑料感
美妆玻璃瓶修图最怕高光断裂、瓶身变塑料和标签糊掉。本文按步骤拆解玻璃瓶高光、瓶肩反射、标签清晰度和交付复核,适合拿来做批量修图前的检查表。
商品图验收先看好看,还是先看可复核?
商品图验收只写好看一点,最后容易变成审美争论。本文把主观口径和可复核证据语言放在一起比较,说明图叮如何帮运营、客服和修图师减少返工。
吸盘碗餐盘产品图怎么修:硅胶哑光、吸盘底和分格立体的常见问题一次答清
搜吸盘碗餐盘怎么修的人,多半卡在硅胶哑光修没了、吸盘底拍不清、颜色偏、分格没立体感这几件事上。这篇按大家真正在搜的问题一条条答,讲清吸盘碗餐盘产品图怎么修得自然真实,以及母婴餐具哪些材质和吸附承诺不能靠修图去夸。
吊床摇椅产品图怎么修:网绳镂空抠图、编绳帆布质感和悬挂结构的常见问答
吊床摇椅这类户外家具最难修的就是网绳镂空一堆抠不净、编绳帆布的质感拍糊、悬挂结构一动就假。这篇按大家常搜的问题聚成问答,讲清怎么用图叮一键抠图抠净网绳、材质高清修复还原编绳帆布、产品溶图打光把吊床摇椅放进庭院场景,也说清质感和尺寸要跟实物一致的边界,效果以图叮官网为准。
储物柜收纳柜产品图怎么修:柜门色差、拉手金属光和门缝阴影一步步修匀
储物柜收纳柜拍出来常见的毛病是几扇门颜色深浅不一、拉手灰扑扑没金属光、门缝里一道死黑阴影。这篇按抠图、修门板色差、修拉手、修门缝、补场景光的顺序,讲清储物柜收纳柜产品图怎么修得整齐又不失真,也说清板材环保和内部容量为什么不能靠修图去编。
产品溶图打光怎么才不假
产品溶进新背景后总透着一股假,多半不是抠得不好,是光没对上。这篇按选底图、放产品、打光、统色温四步走,每步挂一个踩坑警告,配一个手账溶进木桌的翻车实例,最后给一条假了往回倒查的路径,帮你把飘在背景上的产品踩回地面。
AI 修图做儿童 / 婴幼儿类目:广告法、平台审核和真实安全感的 5 个合规要点
儿童和婴幼儿商品图不是修得越像越好。本文按广告法、平台审核、肖像权和真实安全感四条线,拆 AI 修图在母婴场景里的 5 个合规要点,截至 2026-04 的实操经验。
为什么汽车灯具电商主图需要专业抠图?
title: 抠图优化汽车灯具电商主图:提升转化率的视觉利器 keywords: 汽车灯具, 抠图提效, 电商视觉, 图叮AI, 主图优化 description: 面对汽车灯具类目激烈的电商竞争,如何通过高效抠图提升主图质感?本文拆解车灯抠图的难点,并给出结合图叮AI抠图与平台规范的处理流程,帮助商家打造高点击主图。