11个AI模型干同一件小事,最便宜的只花2.4个积分!
花最贵的钱,真能买到最漂亮的网页吗?
同一个需求,11个AI模型各自生成咖啡店网页。最贵的花了1055个积分,最便宜的只用了1.3个积分,差价超过800倍!但多付800倍的钱,效果真的好了800倍吗?
Netlify公司在2026年8月12日发布了一份很有意思的测试报告。这家提供网站托管和开发工具的公司,刚刚和OpenRouter平台建立了合作关系。通过这次合作,Netlify的用户可以在自己的项目里调用OpenRouter上提供的各种AI模型。
为了展示不同模型的能力差异,Netlify内部团队做了一个实验。他们用完全相同的提示词,让11个不同的AI模型各自生成一个本地咖啡店的一页式网站。提示词写得很清楚:需要包含营业时间、地址、简短菜单和一张照片,而且明确说了不需要内容管理系统,页面内容固定不变。
每个模型都跑了三次,最后对比生成结果和消耗的积分数量。
最贵的模型和最便宜的模型,差价超过800倍
积分是Netlify平台里的计费单位。免费套餐有300个积分,个人套餐包含1000个积分,专业套餐有3000个积分。如果用完了,还可以花10美元买1500个额外积分。
测试结果里出现了一个惊人的数字。Claude Opus 5有一次生成花掉了1055个积分。这个数量已经超过了个人套餐的全部积分额度。更离谱的是,这个模型另外两次跑同样的任务,一次花了253个积分,一次花了249个积分。同一种模型,同一个任务,三次生成的积分消耗差了整整四倍。
所有模型里消耗最低的是DeepSeek V4 Flash 0731版本,三次平均只用了2.4个积分。最便宜的一次只花了1.3个积分。把最贵的那次1055个积分和最便宜的这次1.3个积分放在一起算,价格差距超过了811倍。
GLM 5.2也很有代表性。这个模型三次生成的积分分别是15、42和24。同一个模型跑三次,最低和最高之间差了将近三倍。而且这三个页面的视觉风格差异非常大,第一个页面用了大量枫叶色系,第二个页面偏暖棕色,第三个页面则是深色系为主。这种不稳定性意味着,用户如果只跑一次,完全不知道自己会拿到什么结果。
Claude Opus 5那个花了1055积分的网页,究竟长什么样
这个最贵的页面确实很精致。顶部有一个类似印章的设计元素,正中间放了一颗咖啡豆图案。这个图案不是用图片实现的,而是用代码生成的矢量图形,可以单独控制动画效果。页面底部还嵌入了一幅自定义地图。深色模式也内置好了,切换系统主题时页面颜色会自动跟着变。
设计语言偏年轻化,用了两种字体和两种颜色搭配来突出标题。视觉层次很清晰,信息布局疏密有致。但严格来说,这个设计风格在当下的咖啡店网站里已经有些套路化了。
另外两次Opus 5生成的结果也很不错。有一次用了矢量图形绘制了一个咖啡杯的轮廓,另一次做了一个更复杂的装饰性图案。这些矢量图形都需要模型在代码层面精确控制坐标和路径,生成难度比直接用图片高得多。
但问题是,那个花了1055个积分的版本,真的比花了249个积分的版本好四倍吗。从视觉效果来看,确实更精致一些,但差距并没有积分数字显示得那么夸张。这说明Claude Opus 5在部分情况下会出现过度消耗积分的倾向,而这种超额消耗并不总能带来相应比例的质量提升。
GPT 5.6 Terra只用39个积分,效果却不差
GPT 5.6系列有多个版本。Sol是高配版本,Terra是中配版本,Luna是低配版本。这次测试里,Sol用了低努力模式,Terra用了默认设置。
Sol低努力模式三次平均消耗141个积分。生成的页面内容比较丰富,排版干净利落,图片选择也还算贴合咖啡店的主题。虽然比Claude Sonnet 5的143个积分略低一点,但视觉呈现上明显更成熟。
Terra版本的平均消耗只有39个积分。这个价格只有Sol低努力模式的三分之一左右。更让人意外的是,Terra生成的三次页面里,有一次的视觉效果和Sol的水平很接近,只是页面内容稍微单薄一些。另外两次出现了小问题,一张图片没有加载出来,还有一次文字和背景的对比度不够高。但这些都属于可以手动修复的小毛病,不影响整体布局的合理性。
如果把Claude Opus 5最贵的那次1055个积分和GPT 5.6 Terra的39个积分放在一起看,前者价格是后者的27倍。但两个页面放在一起比较,绝大多数人不会觉得前者比后者好27倍。
Gemini两代产品的差距,像两个不同公司做的
Gemini 3.1 Pro三次平均消耗53个积分。生成的页面只有一个白色背景,上面列出了营业时间、地址和菜单。没有配色方案,没有装饰元素,没有图片,甚至连字体都没有做任何美化。三个不同次数的生成结果几乎一模一样,都是白底黑字的纯信息列表。
Gemini 3.6 Flash三次平均消耗103个积分,价格比3.1 Pro高了将近一倍。但页面质量提升非常明显。3.6 Flash生成的页面有了完整的配色体系,配了图片,菜单卡片做了圆角设计,有些版本甚至还加了简单的动画过渡。内容量也比3.1 Pro丰富得多,不光列出了菜单名称,还加了简短的菜品描述。
不过Gemini 3.6 Flash也有自己的问题。三个生成结果都非常长,页面内容重复性很高。菜单部分反复强调同几款咖啡,文字描述翻来覆去用相似的句式。这种重复感说明模型在内容生成上缺少有效的多样性控制机制。
开源的Kimi和GLM,价格便宜但表现飘忽
Kimi K3被宣传为擅长处理长周期代理任务的前沿模型,测试团队也明确说这种简单的设计类任务并不是它的强项。三次平均消耗102个积分,生成的页面确实没有太多亮点。设计语言比较平淡,内容组织上中规中矩,没有特别出彩的地方,也没有明显错误。
Kimi K2.7 Code版本更老,三次平均只消耗19个积分。页面更简单,基本就是一个基础的信息展示页,几乎没有什么设计痕迹。考虑到它的价格,这个结果也算合理。
GLM 5.2是文本模型,不支持图像输入。这意味着用户没法给模型看参考图说按照这个风格做。三次平均消耗27个积分。第一个页面大量使用了枫叶色系和圆润的字体,视觉统一性不错。第二个页面偏暖棕色系,配了一张手绘风格的咖啡壶插画。第三个页面颜色偏深色系,布局更紧凑。
同一个模型,三次生成用了三种完全不同的配色方案和视觉语言。这种多样性在某些场景下是优势,因为用户可以选择最满意的那一版。但在需要稳定输出的场景里,这种飘忽不定的表现就成了缺点。
DeepSeek V4 Flash 0731只花2.4个积分,效果却超出预期
V4 Pro是稍早的版本,三次平均消耗37个积分。生成的页面里,有一次的图片链接指向了一个不存在的文件。这个问题在商业模型里已经很少见了,说明V4 Pro在生成代码时的准确性还有提升空间。
V4 Flash 0731是最新的修订版本,三次平均消耗2.4个积分。最便宜的那次只用了1.3个积分。按照Netlify的定价,10美元可以买1500个积分,1.3个积分折合人民币大约6分钱。
这个价格生成的页面,中间那次结果相当完整。有配色方案,有菜单卡片,有营业信息和地址,甚至还有一张咖啡图片。页面布局合理,信息层级清晰。虽然比不上Claude Opus 5最精致的那个版本,但比起Gemini 3.1 Pro那种白底黑字的信息列表,视觉效果明显高出一个档次。
从成本效益的角度看,DeepSeek V4 Flash 0731是这个测试里的性价比之王。6分钱人民币换一个能直接用的咖啡店网页,这个效率已经远远超出传统开发方式的想象。
同一个模型跑三次,积分消耗和页面质量都不稳定
这次测试里最值得注意的现象不是模型之间的差异,而是同一个模型跑三次的不稳定性。
Claude Opus 5三次消耗是253、249和1055,波动范围超过四倍。GLM 5.2三次消耗是15、42和24,页面风格完全不同。DeepSeek V4 Flash 0731三次消耗是3.4、1.3和2.5,页面复杂度也有明显区别。即使是价格最低的Kimi K2.7 Code,三次生成的页面在排版细节上也有细微差异。
这种不稳定性意味着,用户在使用这些模型时,每次得到的结果都带有一定的随机性。同一个模型,同一个提示词,同样的平台设置,跑出来的结果可能差很多。对于用户来说,如果第一次生成的结果不满意,多跑几次可能就会拿到更理想的效果。但这同时也意味着,模型的可靠性还没有达到传统软件工具的稳定水准。
测试团队也提到了一个关键区别。在这次测试里评估的主要是页面的视觉设计和文案质量。但对于更复杂的项目需求,比如数据库集成、用户认证、文件存储、AI网关调用等功能,评估标准就完全不同了。
到时候考察的重点会变成模型知不知道什么时候该用数据库,会不会正确调用Netlify的数据库接口,能不能处理好用户上传的图片,以及AI功能是否对接了正确的网关地址。这些问题直接关系到项目能不能真正跑起来,而不仅仅是好不好看。
在后续测试里,测试团队会分享更复杂场景下的模型表现数据。届时可能会发现某些在简单任务里不突出的模型,在处理复杂项目架构时反而更有优势。也可能有模型在简单任务里表现很好,但在需要调用平台特定功能时就掉链子。
这次测试还揭示了一个更深层的问题。当同一个模型三次跑同一个任务,结果差异这么大的时候,用户到底该怎么选择。如果完全信赖某个模型,但恰好碰上了一次发挥失常的生成,结果可能还不如用更便宜的模型碰上一次发挥超常的生成。
从实际使用的角度看,合理的策略可能是根据项目预算选择合适的模型档次,然后多跑几次从结果里挑选最满意的那版。对于预算有限的用户,DeepSeek V4 Flash这种超低成本的模型可以毫无压力地跑很多次,从中挑出最好的结果。对于预算充足的用户,用Claude Opus 5或者GPT 5.6 Sol跑几次,选最满意的版本使用。
无论是哪种选择,有一点是确定的。在2026年这个时间点,花6分钱人民币就能让AI生成一个完整的咖啡店网页,这件事本身就已经超出了大多数人的预期。技术的进展总是先让人惊讶,然后习以为常,最后彻底改变做事的习惯。
原文期刊:Netlify官方博客 / 发表日期:2026年8月12日 / 原文标题:More models, more choice: Comparing 11 different AI models / 作者单位背景:Netlify产品团队