标准、数据、评测与关键取舍主责
CASE 02 / IMAGE MODEL STRATEGY/ Diffusion Transformer
流程速览 ↓DESIGN SPECIALTY
把审美→变成标准/ 可学习
面向大众高频设计场景,我负责把“画面不好看”的模糊问题,拆成数据治理、 Caption 规则、定向评测和版本选型可以共同执行的模型效果系统。
T2I+EDIT 设计场景 GSB 正向提升
标准、评测与数据动作已形成闭环
大众高频设计场景重点覆盖
样本规模不是线性堆大,而是在不同训练阶段逐步收敛为可学习、可评测、可回流的资产。
THE PROBLEM
议题:先判断模型到底缺了哪种设计认知。
早期结果能生成完整画面,但“不像小红书封面”“不像电商主图”“字体和版式不成立”。 这些不是单一审美问题,而是场景、字体、版式、图文关系四类训练语言缺口。
场景词响应弱
小红书封面、电商主图等场景能生成画面,但不像真正服务对应媒介的设计。
字体表达窄
字体气质、字重差异和小字稳定性不足,结果容易停留在少数常见字形。
版式层级平
标题、数字、主体和辅助信息缺少稳定浏览路径,高密度信息容易堆在一起。
图文像叠图
文字、人物、商品和装饰元素之间缺少关系描述,画面完整但传播动作不成立。
THE DECISION
议题:为什么不继续用 Prompt / PE 修补结果。
更快的路径是继续修 Prompt;更长期的路径,是把设计问题转译成模型能学习、 团队能协作、版本能评测的系统。我选择后者,并把难题按 ROI 拆出节奏。
继续靠 Prompt / PE 修补
短期能让少数样例变好,但无法让模型稳定理解场景、字体和版式关系。
建设数据、Caption 与评测系统
把主观审美拆成可训练、可验收、可回流的工程语言,支持后续版本继续复用。
把未完成问题单独拆出
仍未稳定解决的问题进入独立问题池,避免影响阶段版本判断。
THE SYSTEM
议题:把主观判断转译成训练、评测和协作语言。
把审美标准翻译成训练系统
这套系统的关键不是流程好看,而是让审美判断进入数据、Caption、评测和回流; 之后每一次版本判断都有共同语言,而不是靠单人主观拍板。
把用户能感知的设计问题转译成标准、数据、Caption、评测和 ROI 取舍,再回到下一轮规划。
构图层级
主次关系、视觉动线、留白与信息密度。
视觉表现
风格完成度、色彩质感与细节精致度。
信息传递
核心信息获取、易读性与记忆点。
VISUAL EVIDENCE
议题:用前后版本对照,检查设计意图是否真的被理解。
同一需求,见前后版本差异
四组素材覆盖商品展示、社媒封面、文化 Banner 与电商详情页;每组以同类需求下的旧版与新版输出对照, 观察场景语境、图文关系、信息层级与行业格式是否更接近真实生产需求。
商品亮点能否被组织成视觉叙事
考察 / 商品、口味与卖点,能否围绕同一个购买理由被组织。
平台语境是否被正确响应
考察 / 人物、主题字与直播信息,能否共同形成社媒内容的进入感。
高密度画面能否保留视觉中心
考察 / 多人物、主标题与辅助文字,能否在强冲击下仍形成有序阅读。
用户意图能否被转成行业格式
考察 / 当需求指向详情页时,模型能否主动输出长图结构和模块化信息。
STAGE RESULTS
议题:为什么这不只是一批更好的图。
项目仍是阶段性成果,但最新评测已经能确认:相对上一版取得 +50% 的正向提升; 同时,后续评测也暴露出新的问题,并据此形成下一阶段优化方向,拉齐多方对齐节奏进入下一版本。
有效收益
- 相对上一版取得 +50% 的阶段性正向提升
- 设计生成结果更接近可继续打磨的方案初稿
- 评测链路能够支撑版本判断与复盘
新问题识别
- 后续评测继续暴露新的质量与理解问题
- 已据此形成下一阶段优化方向
- 拉齐多方对齐节奏进入下一版本
可复用资产
- 设计标准基于发现问题迭代后复用
- 数据与评测沉淀可回溯
- 合成链路服务其他场景
角色定义 / BETWEEN MODEL AND EXPERIENCE
模型能力与用户体验之间需要一套可执行的效果策略
该项目代表我的工作方式:先从用户能够感知的问题出发,把模糊的审美判断拆成团队可以协作的标准、数据和评测机制,再变成可验证的模型结果,最后判断新一轮的用户痛点。