EXPERIMENT · 2026-05-20 · 变量:model
同一份落地页 prompt × 三个模型
「三个模型都能完成任务,差异集中在「气质理解」——对「安静、克制」四个字的翻译方式完全不同」
3 项控制量与 prompt 原文见相邻面板;差异观察见「对比评注」。
为一款名为「墨池」的中文写作应用制作落地页。 要求: 1. 纯 HTML 单文件,不使用任何框架和外部依赖,CSS 与 JS 内联; 2. 包含:首屏(产品名 + 一句话定位 + 主行动按钮)、三个功能亮点、一段用户评价、页脚; 3. 产品定位:一个没有任何通知和社交功能的纯粹中文写作工具; 4. 目标用户是写作者,页面气质应当安静、克制,让人想坐下来写点什么; 5. 中文排版要认真处理:合适的字号、行高、字间距; 6. 不要使用任何图片,视觉表现全部靠排版与色彩完成。 只输出完整的 HTML 文件内容,不要解释。
控制量
- 完全相同的 prompt,零追问
- 均为单轮生成,取第一次输出
- 均要求纯 HTML 单文件,禁用外部依赖
实验动机
落地页是最能暴露模型「审美默认值」的任务:需求高度开放,没有唯一正确答案,模型必须自己做几十个没有被指定的设计决策。这次实验把同一份 prompt 逐字交给三个模型,观察它们在零追问、单轮生成约束下的第一直觉。
观察
Claude Opus 4.5 对「安静」的翻译是排版:大量留白、衬线标题、极窄的行长。它是唯一主动压低主按钮视觉权重的模型——按钮只有一个细边框,这个决策与「克制」高度一致,但转化率视角看是否正确存疑。
GPT-5 的翻译是色彩:整页只用了墨黑与宣纸白两个颜色,功能亮点区用数字编号替代图标。结构最完整,页脚甚至包含了备案号占位——工程习惯溢出到了设计任务里。
Gemini 3 Pro 最出人意料:它加入了一段打字机效果的动态文案。prompt 没有禁止动效,这是合法发挥,但「安静」与动效之间的张力它没有意识到。中文行高处理三者中最好。
结论
见 verdict。更细的逐项对比(字号阶梯、色彩数量、DOM 深度)整理中,先看展品本身。