霍格沃兹测试开发学社

《Python测试开发进阶训练营》(随到随学!)
2023年第2期《Python全栈开发与自动化测试班》(开班在即)
报名联系weixin/qq:2314507862

DeepSeek Harness火了,2027届测试开发校招生应该学什么?

关注 「软件测试就业联盟」公众号,陪你走好校招求职的每一步

2026年8月13日晚,DeepSeek 开源了首款 Agent 产品 DeepSeek Harness(简称 dsh,仓库 deepseek-ai/deepseek-harness):上线半小时破 1 万星,12 小时破 5 万,约 42 小时破 10 万,被不少人称为"GitHub 史上最快涨星项目"之一。做个参照:当年 DeepSeek-R1 拿 2 万星用了 5.7 天,Grok-1 用了 1.2 天。这也是 DeepSeek 第一次从"造模型"走向"造 Agent 产品"。

看到这份数据,我的第一反应不是去 clone 代码,而是想到我们高校实训带的那批学生——他们手里的学习清单,是对着 2025 年的招聘需求列的,而 2027 年的校招需求,几乎不可能原封不动。这篇文章,我把测试开发校招生该学的东西重新排了三层,文末附一张优先级表。

为什么 dsh 值得测试人认真对待
很多人把 dsh 当成"又一个 AI 工具",我更愿意把它看成一次"测试对象换物种"的信号。三个事实。

第一,它的口号是"一切皆插件"(Everything is a Plugin):Model Adapter、Tool Registry、Session Log、Agent Loop 全部可插拔、可替换、可检查,底层由 Cordis 插件治理框架驱动。测试对象不再是一个写死的程序,而是一套可以任意组合的插件系统。

第二,它的终极目标是自进化智能体框架(Self-Evolving Agent Harness)——Agent 在运行中自己编写、安装插件,错误修改还能撤回。内测者的描述是:Agent 能自检运行状态、即时编写并安装插件,并在后续任务中复用。

第三,行业讨论的焦点已经从"怎么用"转向"怎么测":当测试对象变成会自我演化的系统,传统测试方法面临重构。

这三条加在一起,这波浪潮和测试人的关系就藏不住了。

第一层:不变的底座,继续学,但换个学法
编码能力仍是入场券。dsh 跑在 Node.js 生态,社区教学项目 mini-dsh 是 TypeScript 写的,想读源码、写插件,Python 或 TypeScript 至少要精通一门。学习标准要往上抬一档:不是"会写算法题",而是"能完整读进一个开源项目的实现"。

计算机基础一点没贬值。操作系统、网络、数据结构,将来排查"Agent 为什么卡住、为什么循环打转"时,靠的还是这些。

测试设计思维是被低估最深的底座。等价类、边界值、状态迁移,这些方法回答的是"怎么用少数用例暴露多数问题";到了 AI 时代,它们恰好是你评审 AI 生成用例的标尺。落地方式很朴素:用 pytest 给小函数写用例,刻意练习"先设计、后编码"。

练习测试设计思维的示例:等价类 + 边界值设计用例

import pytest

def calc_shipping(weight_kg: float, distance_km: int) -> float:
"""示意被测函数:运费计算,首重1公斤起步价,超重按公斤加价,长途打折"""
...

@pytest.mark.parametrize(
"weight, distance, expected",
[
(1.0, 50, 8.0), # 边界:恰好首重
(2.5, 50, 14.0), # 常规:超重计费
(0.0, 50, 0.0), # 边界:零重量
(2.0, 1000, 11.4), # 等价类:长途打折
],
)
def test_calc_shipping(weight, distance, expected):
assert calc_shipping(weight, distance) == pytest.approx(expected)
练的不是这个函数的写法,而是"写代码之前先想清楚要测什么"的习惯。

第二层:权重上升的,现在就要排进课表
AI 应用测试。LLM 输出是非确定性的:同样的输入,每次输出都可能不同,传统的"相等断言"不够用了。你得会三层功夫:结构校验(JSON 字段是否齐全、类型是否正确)、语义抽查(内容是否"说得通"、有没有幻觉)、统计通过率(跑 N 次看达标比例)。我们实测 dsh 时发现的响应偏慢、复杂长任务稳定性不足这类短板,如何稳定复现、如何量化,正是 AI 应用测试的核心工作。

提示词与上下文工程。测试开发不用会训模型,但要懂上下文是怎么构建、怎么被消费的。在 dsh 里,连 Session Log 都是可插拔组件——懂了上下文管理,就懂了 Agent 行为的一半。练到能用提示词把 AI 输出稳定成可校验的结构,就算入门。

第三层:全新的,先学就是先超车
Agent/插件开发。别被"开发"两个字吓住。插件化架构下,写一个工具插件和写一个函数差不多。下面是简化示意(不是 dsh 真实 API,只为展示插件的大致形态):

// 简化示意:非 dsh 真实接口,仅展示"一切皆插件"的基本形态
export default function wordCountPlugin(ctx: {
registerTool: (tool: unknown) => () => void;
}) {
const dispose = ctx.registerTool({
name: "word_count",
description: "统计一段文本的字符数",
async execute({ text }: { text: string }) {
return { count: text.length };
},
});

// 插件卸载时撤销副作用,对应"可回滚副作用"(Revertible Effects)的思路
return () => dispose();
}
评估体系。自进化的系统需要一把"不随它变化"的尺子:固定任务集、多维指标(成功率、耗时、成本)、回归基线。我们实测发现 dsh 的 API 成本会随任务长度放大——不做成本度量,这类问题根本发现不了。这个方向现在人少、值钱、保质期长。

一张学习优先级表
优先级
内容
为什么
建议动作
P0
编码能力(Python/TS)
读源码、写插件的入场券
完整读一个开源项目,如 mini-dsh
P0
测试设计思维
评审 AI 输出的标尺
每周用 pytest 写等价类/边界值用例
P1
AI 应用测试
非确定性系统正成为主流被测对象
学结构校验、抽样断言、统计指标
P1
提示词与上下文工程
理解 Agent 行为的前提
实际跑一次 dsh,观察它的上下文变化
P2
Agent/插件开发
直接对应新型岗位要求
给开源项目写一个工具插件
P2
评估体系
人少、值钱、长期红利
为一个 Agent 任务集设计度量方案
P0 是地基,缺了什么都免谈;P1 决定你第一份工作的竞争力;P2 决定你三五年后能走多远。

节奏建议
别指望一口气学完。我的建议是:每个学期把一项 P0 打扎实,同时穿插一个 P1 专题;寒暑假集中做一个 P2 级项目,比如跑通 dsh 写份体验报告,或者给开源项目写个小插件。节奏不快,但一年下来,你会比同龄人整整多出一层积累。

最后说一句
这一轮变化真正淘汰的不是某项技能,而是"只按招聘要求学"的惯性。dsh 从发布到超过 15 万星只用了短短几天,这个速度在提醒每个人:新世界不会等你把学习计划做完。

本文整理自霍格沃兹测试开发学社的原创分享,更多测试开发与 AI 测试实战内容,我们下一篇见。

我们整理了:

✅ 内推机会同步 ✅ 大厂/央国企招聘信息

✅ 简历优化建议 ✅ 测试岗能力模型

👉 扫码进群,获取最新岗位信息。

image

关于我们
霍格沃兹测试开发学社,隶属于 测吧(北京)科技有限公司,是一个面向软件测试爱好者的技术交流社区。

学社围绕现代软件测试工程体系展开,内容涵盖软件测试入门、自动化测试、性能测试、接口测试、测试开发、全栈测试,以及人工智能测试与 AI 在测试工程中的应用实践。

我们关注测试工程能力的系统化建设,包括 Python 自动化测试、Java 自动化测试、Web 与 App 自动化、持续集成与质量体系建设,同时探索 AI 驱动的测试设计、用例生成、自动化执行与质量分析方法,沉淀可复用、可落地的测试开发工程经验。

在技术社区与工程实践之外,学社还参与测试工程人才培养体系建设,面向高校提供测试实训平台与实践支持,组织开展 “火焰杯” 软件测试相关技术赛事,并探索以能力为导向的人才培养模式,包括高校学员先学习、就业后付款的实践路径。

同时,学社结合真实行业需求,为在职测试工程师与高潜学员提供名企大厂 1v1 私教服务,用于个性化能力提升与工程实践指导。

posted @ 2026-08-29 21:27  霍格沃兹测试开发学社  阅读(31)  评论(0)    收藏  举报