1037Solo·过程博物馆GH/AIMFllys · GH/AIMFllyYS
EXPERIMENT · 2026-05-20 · 变量:model

同一份落地页 prompt × 三个模型

「三个模型都能完成任务,差异集中在「气质理解」——对「安静、克制」四个字的翻译方式完全不同」

3 项控制量与 prompt 原文见相邻面板;差异观察见「对比评注」。

为一款名为「墨池」的中文写作应用制作落地页。

要求:
1. 纯 HTML 单文件,不使用任何框架和外部依赖,CSS 与 JS 内联;
2. 包含:首屏(产品名 + 一句话定位 + 主行动按钮)、三个功能亮点、一段用户评价、页脚;
3. 产品定位:一个没有任何通知和社交功能的纯粹中文写作工具;
4. 目标用户是写作者,页面气质应当安静、克制,让人想坐下来写点什么;
5. 中文排版要认真处理:合适的字号、行高、字间距;
6. 不要使用任何图片,视觉表现全部靠排版与色彩完成。

只输出完整的 HTML 文件内容,不要解释。
控制量
  • 完全相同的 prompt,零追问
  • 均为单轮生成,取第一次输出
  • 均要求纯 HTML 单文件,禁用外部依赖

实验动机

落地页是最能暴露模型「审美默认值」的任务:需求高度开放,没有唯一正确答案,模型必须自己做几十个没有被指定的设计决策。这次实验把同一份 prompt 逐字交给三个模型,观察它们在零追问、单轮生成约束下的第一直觉。

观察

Claude Opus 4.5 对「安静」的翻译是排版:大量留白、衬线标题、极窄的行长。它是唯一主动压低主按钮视觉权重的模型——按钮只有一个细边框,这个决策与「克制」高度一致,但转化率视角看是否正确存疑。

GPT-5 的翻译是色彩:整页只用了墨黑与宣纸白两个颜色,功能亮点区用数字编号替代图标。结构最完整,页脚甚至包含了备案号占位——工程习惯溢出到了设计任务里。

Gemini 3 Pro 最出人意料:它加入了一段打字机效果的动态文案。prompt 没有禁止动效,这是合法发挥,但「安静」与动效之间的张力它没有意识到。中文行高处理三者中最好。

结论

见 verdict。更细的逐项对比(字号阶梯、色彩数量、DOM 深度)整理中,先看展品本身。