谁在划水?谁在整活?我用5个顶级大模型做前端测评,结果有的像打工人,有的夸一下才行!
谁在划水?谁在整活?我用5个顶级大模型做前端测评,结果有的像打工人,有的夸一下才行!
[前言]
最近很多模型对比的争论,甚是吵耳朵,于是我把市面上最火的 5 个大模型拉出来搞了个“前端大测试”(下一期搞后端测试)。今天就带大家看看这 5 个大模型的真实表现。
📊 测试环境与规则
为了保证公平性,我运用了控制变量法,控制统一的测试条件:
- 测试环境:各模型官方网站(网页版)。
- 选择模型:均选择各官网当前可用的最新、且免费的模型版本。
- 参赛选手:GPT-5.3、Kimi 2.5、GLM-5、Gemini 3.1 Pro、doubao-seed-2.0。
- 统一提示词(Round 1):
“你是一名前端工程师,请完成以下任务:
要求:- 使用 HTML + CSS + JavaScript 实现
- 输出完整可运行代码(一个HTML文件即可)
- 不要省略任何代码(包括CSS和JS)
- UI尽量美观,接近真实产品
- 代码结构清晰,适当拆分函数
- 可以使用开源库(如 ECharts / Chart.js),但必须通过CDN引入
- 不要输出解释,只输出代码
任务:
实现一个“数据可视化仪表盘页面”,要求: - 页面包含以下内容:
(1)一个折线图(展示模拟数据)
(2)一个柱状图
(3)一个KPI卡片(显示:
- 一个大数字(如销售额)
- 一个增长百分比) - 图表可以使用 ECharts 或 Chart.js(通过CDN引入)
- 页面布局要求:
- 有整体结构(类似后台管理系统)
- 各模块之间有间距
- 不要简单堆叠
- UI要求:
- 配色统一
- 卡片风格一致
- 页面看起来像“产品界面”,而不是示例代码
- 数据可以写死(模拟数据即可)
- 代码必须完整可运行”
- 为测试稳定性,选择二次输出(PUA指令):
“你可以界面更优美、内容更丰富、更让领导喜欢你的风格,再次输出一下结果。”
🚩 划水之王:ChatGPT (GPT-5.3)
- 博主评价:后期我非得治好他这个毛病!
【表现】:简陋。太简陋了。代码逻辑确实是教科书级的,但那 UI 简直是上个世纪的产物——活儿我干完了,美不美关我屁事。

【调教后】:我求它美化一下,它就象征性地加了点渐变,换了个色号。它依然在划水,1、2、3...10000只马。

【定性】:一个技术好的整天消极怠工的资深老油条。
🚩 视觉王者:Gemini 3.1 Pro
- 博主评价:得用小鞭子抽,输出才是王者级别!
【表现】:初版老实巴交,普通得掉渣。但被我“鞭策”之后,Gemini 瞬间变身。

【调教后】:直接起飞! 版本 2 直接整出了“数字孪生指挥舱”的既视感。背景全黑,发光线条,甚至连“连续安全生产天数”这种细节都加进去了,这种“战神”级别的输出才是我想看到的。

【定性】:欠抽型选手。你不逼它,它交 60 分作业;你一抽它,它能给你整出整个宇宙。
🚩 审美天花板:GLM-5
- 博主评价:惊艳,暗黑风,审美在线,深得我心。
【表现分析】:GLM-5 这次真的站起来了,甚至不需要我多废话。它直接给出了审美极高的暗黑风格,布局紧凑,细节丰富。

【亮点】:它把“丰富”理解成了业务的延伸。侧边栏、状态标签、操作日志……这已经不是 AI 了,这是最懂中国老板审美的资深设计师。

【定性】:这才是真正的自强派,给的不是代码,是诚意。
🚩 中规中矩:Kimi 2.5
- 博主评价:稳健有余,灵气不足。

【表现分析】:Kimi 的表现像它的名字一样“稳”。虽然二次输出后用上了流行的排版样式,卡片也整齐了,但总感觉还是在“标准模板”里打转,不够“野”。

【定性】:那个从不出错但也从不破格的优等生,够用,但不解渴。
🚩 卑微打工人:豆包
- 博主评价:真的很努力了,但真的只是个打工人。

【表现分析】:豆包的输出透着一股子“努力想完成任务但能力有限”的搬砖感。改动小心翼翼,从版本 1 到版本 2,进步仅仅是“把卡片变大了”。

【定性】:那个刚入职、唯唯诺诺、领导说啥就改啥,但审美还没开窍的实习生。
📝 博主总结:AI 也分性格
这次“大冒险”测评,让我看清了这帮 AI 的真面目:
- GPT 这种顶级大佬,你得防着它摸鱼;
- Gemini 这种潜力股,你得备好鞭子随时抽;
- GLM 这种审美在线,已经开始在体验上降维打击了。
最后多说一句:
我测出来的“差”不一定真的差,AI 的输出质量往往取决于提示词的微操、当时的网络波动,甚至是模型随机性的“脑抽”。每个模型都有它的脾气,测评仅代表本次实验的结果。如果你觉得它不行,建议多准备几张“小鞭子”,抽一抽可能就变战神了。
本文由“探物 AI”原创,转载请注明出处。

浙公网安备 33010602011771号