DeepSeek 还没官宣的桌面版,我抢先装上跑了一遍,结果有点炸
DeepSeek Harness 的桌面安装包,已经在社区里传开了。
亲测可用!

这里有个挺有意思的细节:我顺着社区流传的地址完成安装,版本号为v0.1.7-rc.1,刚打开没多久,客户端就提示有新版本。本次体验版本号:v0.1.7-rc.2
截至这次体验时,DeepSeek 还没有正式官宣。
社区讨论很快分成了两个方向:一边开始研究它能做什么,另一边在追问,这到底是不是官方客户端?
这里先回答第二个问题,的确是官方版本,下载地址我直接放到评论区,需要体验的自取。
目前还是带有 beta 字样的测试版本,但是 GUI 和功能已经非常完善。
安装完成之后它会提示你登录或者配置 API

跳转到网页端,完成登录,就可以打开 Harness 桌面端使用了

Image
随后,DeepSeek Harness 会询问用户的使用需求,把场景分成办公科研、代码开发 2 个类别

以及它会让你选择想要看到思维链的完整度
这里我选择了完整过程(这里我建议大家选完整过程,在后期调整提示词和出了问题溯源的时候非常有用)

进入客户端后,Harness 提供了四种工作方式:标准模式、PTC 模式、极简模式和创造模式。

此外,一直如既往,DeepSeek Harness 的 slogan 是万物皆可插件,这次,在工作目录栏的设置了插件功能,有 7 个基础插件,大家也可以根据自己的需求自行安装插件

总体来看,这已经很像一个面向普通人的 AI 产品引导了。
这些问题看起来很日常,但它们透露了产品在尝试服务谁。
熟悉 Agent 的开发者,往往知道自己需要什么工具、怎样配置。
普通用户更容易回答的问题是:我准备拿它做什么?
我们的判断是,这套引导正在把 Harness 的入口,从环境配置转向任务选择
下面开启的体验!
/实测DeepSeek Harness,对比 ChatGPT 桌面端/
让 DeepSeek Harness 先来的完成一个简单的任务:读取我本地的 macos 系统,做的一个的模拟 macos 的演示网页

选用这个任务原因有三个:1.读取本地环境的能力;2.拆解任务和执行能力;3.模型能力,这里我选择的是最常用的 DeepSeek V4.1 flash,先用 flash 试试吧
当我把这个任务丢给它之后,我前面选择思维链完整过程的优势开始凸显出来。DeepSeek Harness 把整个任务规划得非常细腻,并且还有简单的缩略图,具体在响应哪一部分提示词,是否在调用工具和模型,一目了然

但情况有点不对劲,发现 Harness 正在大段读我本地文件(这个赖我,Prompt 是这么写的),并且任务规划得越来越复杂。
我紧急停止了任务,重新追加了一条提示词

这里要说一下,DeepSeek Harness 还是没有像 GPT-6 一样在任务过程中随时追加提示词的能力。
我只能停止,追加,重启任务。
这次很快,它完成了。输出给了我一个 index.html 和一个 readme

看到效果之后,非常震惊!
说实话,我有点不敢给你们录屏,因为电脑上有一些个人隐私
这里截图给大家看一下桌面
这是 DeepSeek Harness 做的
这是我的真实桌面,不能说和我本地非常相似,简直是一模一样

除了文件打不开,几乎所有的图标都是可交互、可点击,滑动非常丝滑
涉及个人隐私,全局演示我就不做了,这里我做一下遮挡,放一个有限演示,大家可以看一下丝滑度和交互感
之前 GPT-6 Astra 用习惯了,觉得 flash 模型大概率一般,这次真的有被震撼到,真香。
当前视频无法在平台播放,请访问原文链接查看:https://mp.weixin.qq.com/s/Opwf0uYwYsw8cFbk35O10Q
这个项目测下来,它对我本地的模拟真的非常像非常丝滑了,同时它的弊端也非常明显,很快,我的电脑就收到了这个提醒
前两天刚清理完的硬盘又满了

做完之后,我就在想,用 Codex+GPT-6 会做成什么样
我清理了磁盘,把同样的提示词给了 codex
这里我没有用 Astra,而是选用的和 V4.1 flash 同一定位的 Luna

大家可以看一下效果
当前视频无法在平台播放,请访问原文链接查看:https://mp.weixin.qq.com/s/Opwf0uYwYsw8cFbk35O10Q
说实话,跑完这一轮,我坐在电脑前愣了一会儿。
这个结果,和我预想的完全是反的。
我本来以为 GPT-6 会赢。它更贵,推理更久,平时干活也更聪明。结果它交出来的东西,更像是它「理解」了 macOS 应该长什么样,然后凭着这份理解,重新给我画了一个。
而 DeepSeek 那边,用的是最便宜的 V4.1 flash,它把我桌面和硬盘还原得非常真实,甚至我在工作的时候会点错。
总结一下
作为一个长期在 Codex 里使用 GPT-6 的用户,Deepseek Harness 这次给我最直接的感受,就是快。在这个任务里,从思维链推理到交付结果,它的速度优势非常明显,是那种肉眼可见的快好多。
同时,它的思维链非常细致,每一步做了什么、调用了什么非常之清晰,遇到问题回溯、调整提示词非常方便,我愿称之为本次最大亮点。
再说这次 GPT-6 的表现,这个单次测试,有点离谱,有点像是学霸在考场上睡着了。
猜测一下,原因可能是:第一,Codex 对我提示词的拆解出了问题,第二,对于任务规划出了问题
仅凭一个任务的交付结果,还不足以判断模型能力,毕竟它现在是大部分人的生产主力,有实践为证。
这个测试给我带来的感受是:Harness。
所以我最近有个越来越强的判断,可能有点暴论。
往后这一两年,真正拉开差距的,大概率不再是谁家模型分数高那零点几。模型这东西你追我赶,很快就会挤在一条线上,谁也甩不开谁。
真正能分出高下的,是Harness。Agent如何规划任务、拆解任务、执行任务才是核心。
说得再大白话点,是这个产品,到底把你当成一个要伺候的甲方,还是一个要一起干活的搭子。
接下来,想用DSH➕一个顶尖模型试试真实的工作流
反正一上午折腾下来,我删了两次硬盘,看着那个几乎一模一样的假桌面,有一种很奇妙的感觉。
就好像有个东西,第一次不是在猜我想要什么,而是真的走进了我的电脑里,看了我一眼。
这大概,就是 Harness 这个词,最浪漫的地方。

浙公网安备 33010602011771号