谁在划水?谁在整活?我用5个顶级大模型做前端测评,结果有的像打工人,有的夸一下才行!

谁在划水?谁在整活?我用5个顶级大模型做前端测评,结果有的像打工人,有的夸一下才行!

[前言]
最近很多模型对比的争论,甚是吵耳朵,于是我把市面上最火的 5 个大模型拉出来搞了个“前端大测试”(下一期搞后端测试)。今天就带大家看看这 5 个大模型的真实表现。


📊 测试环境与规则

为了保证公平性,我运用了控制变量法,控制统一的测试条件:

  • 测试环境:各模型官方网站(网页版)。
  • 选择模型:均选择各官网当前可用的最新、且免费的模型版本。
  • 参赛选手:GPT-5.3、Kimi 2.5、GLM-5、Gemini 3.1 Pro、doubao-seed-2.0。
  • 统一提示词(Round 1)

    “你是一名前端工程师,请完成以下任务:
    要求:

    1. 使用 HTML + CSS + JavaScript 实现
    2. 输出完整可运行代码(一个HTML文件即可)
    3. 不要省略任何代码(包括CSS和JS)
    4. UI尽量美观,接近真实产品
    5. 代码结构清晰,适当拆分函数
    6. 可以使用开源库(如 ECharts / Chart.js),但必须通过CDN引入
    7. 不要输出解释,只输出代码
      任务:
      实现一个“数据可视化仪表盘页面”,要求:
    8. 页面包含以下内容:
      (1)一个折线图(展示模拟数据)
      (2)一个柱状图
      (3)一个KPI卡片(显示:
      - 一个大数字(如销售额)
      - 一个增长百分比)
    9. 图表可以使用 ECharts 或 Chart.js(通过CDN引入)
    10. 页面布局要求:
      • 有整体结构(类似后台管理系统)
      • 各模块之间有间距
      • 不要简单堆叠
    11. UI要求:
    • 配色统一
    • 卡片风格一致
    • 页面看起来像“产品界面”,而不是示例代码
    1. 数据可以写死(模拟数据即可)
    2. 代码必须完整可运行”
  • 为测试稳定性,选择二次输出(PUA指令)

    “你可以界面更优美、内容更丰富、更让领导喜欢你的风格,再次输出一下结果。”


🚩 划水之王:ChatGPT (GPT-5.3)

  • 博主评价:后期我非得治好他这个毛病!

【表现】:简陋。太简陋了。代码逻辑确实是教科书级的,但那 UI 简直是上个世纪的产物——活儿我干完了,美不美关我屁事。

【调教后】:我求它美化一下,它就象征性地加了点渐变,换了个色号。它依然在划水,1、2、3...10000只马。

【定性】:一个技术好的整天消极怠工的资深老油条。

🚩 视觉王者:Gemini 3.1 Pro

  • 博主评价:得用小鞭子抽,输出才是王者级别!

【表现】:初版老实巴交,普通得掉渣。但被我“鞭策”之后,Gemini 瞬间变身。

【调教后】直接起飞! 版本 2 直接整出了“数字孪生指挥舱”的既视感。背景全黑,发光线条,甚至连“连续安全生产天数”这种细节都加进去了,这种“战神”级别的输出才是我想看到的。

【定性】:欠抽型选手。你不逼它,它交 60 分作业;你一抽它,它能给你整出整个宇宙。

🚩 审美天花板:GLM-5

  • 博主评价:惊艳,暗黑风,审美在线,深得我心。

【表现分析】:GLM-5 这次真的站起来了,甚至不需要我多废话。它直接给出了审美极高的暗黑风格,布局紧凑,细节丰富。

【亮点】:它把“丰富”理解成了业务的延伸。侧边栏、状态标签、操作日志……这已经不是 AI 了,这是最懂中国老板审美的资深设计师。

【定性】:这才是真正的自强派,给的不是代码,是诚意。

🚩 中规中矩:Kimi 2.5

  • 博主评价:稳健有余,灵气不足。

【表现分析】:Kimi 的表现像它的名字一样“稳”。虽然二次输出后用上了流行的排版样式,卡片也整齐了,但总感觉还是在“标准模板”里打转,不够“野”。

【定性】:那个从不出错但也从不破格的优等生,够用,但不解渴。

🚩 卑微打工人:豆包

  • 博主评价:真的很努力了,但真的只是个打工人。

【表现分析】:豆包的输出透着一股子“努力想完成任务但能力有限”的搬砖感。改动小心翼翼,从版本 1 到版本 2,进步仅仅是“把卡片变大了”。

【定性】:那个刚入职、唯唯诺诺、领导说啥就改啥,但审美还没开窍的实习生。


📝 博主总结:AI 也分性格

这次“大冒险”测评,让我看清了这帮 AI 的真面目:

  1. GPT 这种顶级大佬,你得防着它摸鱼;
  2. Gemini 这种潜力股,你得备好鞭子随时抽;
  3. GLM 这种审美在线,已经开始在体验上降维打击了。

最后多说一句:
我测出来的“差”不一定真的差,AI 的输出质量往往取决于提示词的微操、当时的网络波动,甚至是模型随机性的“脑抽”。每个模型都有它的脾气,测评仅代表本次实验的结果。如果你觉得它不行,建议多准备几张“小鞭子”,抽一抽可能就变战神了。


本文由“探物 AI”原创,转载请注明出处。

posted @ 2026-04-13 22:08  探物AI  阅读(181)  评论(0)    收藏  举报