当 AI 编程助手宣布“修复完成”、自动化测试全部通过时,开发者真正的工作往往才刚刚开始。一位开发者在使用 Claude Code 开发软件时,发现自己一度积压了 72 个需要手工核对的项目:有的记在文本文件里,有的留在终端中,有的只存在于脑子里。测试虽然显示绿色,但他并不清楚哪些验证真的做过,哪些只是想过要做。
这段经历让他意识到,与 AI 编程代理协作的难点已经不再只是让模型写出代码,而是确认这些代码在真实环境中是否真的有效。为此,他开发了一个名为 palmtop 的轻量工具,把 AI 声称完成的工作转换成一份可勾选、可回传的人工验证清单。
测试全绿之后,真正的问题才出现
这位开发者描述了自己的日常工作流:先与 AI 代理一起制定功能计划、架构设计和关键决策,再让代理把任务拆分成足够小的阶段。每个阶段结束时,他会要求 AI 同步编写测试,而不是等到最后统一补测试;在进入下一阶段前,他还会阅读关键代码,并进行手工验证。
在他看来,自动化测试并不能替代人工检查。原因在于,代码往往由 AI 编写,测试也经常由同一个 AI 生成,两者可能共享相同的盲区。测试可以验证“代理预期会发生什么”,却未必能发现真实使用中的问题。
例如,页面在 Chrome 中显示正常,但在 Safari 中一片空白;错误提示已经出现,但表单仍然被提交;“记住我”功能在浏览器重启后有效,却在服务器重启后失效。还有一类情况是:代码技术上完成了开发者的要求,但并不符合开发者的真实意图。
这类问题通常只有通过实际使用软件才能发现。而当待验证事项变多后,开发者很容易重复测试同一项、遗漏另一项,甚至一周后才发现原本以为修好的 bug 又回来了。
让 AI 自己列出“该检查什么”
这位开发者表示,自己并不想再做一个新的测试框架,而是想要一个更简单的验证机制。他的思路是:既然 AI 代理知道自己修改了哪些内容,就应该由它生成一份待验证清单;开发者可以在手机上逐项检查,而不必一直守在终端前;验证结果也要能直接回传给 AI,无需复制粘贴。
基于这一需求,他开发了 palmtop。使用时,开发者可以向 AI 代理发出类似“实现第 2 阶段,并把检查项放到 palmtop”的指令。代理完成开发任务后,会写出一份需要人工确认的检查清单。清单会实时同步到已配对的手机、平板或浏览器设备,并触发通知。
开发者在逐项检查时可以标记三种状态:
- ✓:功能正常
- ✕:未通过,并附上简短说明
- ?: 需要更多信息,暂时无法判断
以登录流程为例,检查项可能包括“使用有效邮箱和密码后,是否跳转到仪表盘”“错误密码是否显示提示信息”“刷新页面后表单状态是否符合预期”等。完成一轮检查后,开发者只需告诉 AI“我已经看完 palmtop 上的检查项”或简单回复“Done”,代理就会读取结果。
对于标记为 ✕ 的项目,AI 会尝试修复,并请求开发者再次验证;对于标记为 ? 的项目,AI 会进行解释,而不是直接改动代码。开发者也可以在手机上补充 AI 没有想到的检查项,代理会将这些新增条目与原有反馈一起读取。
本地运行,但仍处于早期阶段
在数据存放方面,palmtop 会在开发者电脑上运行一个小型守护进程,与 AI 代理并行。检查清单、验证结果和备注保存在本地目录 ~/.palmtopai 中。手机等设备通过一个中继服务与电脑通信,该中继只转发消息,不在磁盘上存储内容。
不过,作者也说明,palmtop 目前仍是预览版本:消息通过 TLS 传输,但尚未实现端到端加密,这是路线图中下一项重要工作。在此之前,他建议开发者不要在检查清单中写入密钥、密码等敏感信息。
工具方面,palmtop 目前可直接配合 Claude Code 和 Codex 使用,也支持其他能够执行 shell 命令的 AI 代理。运行环境要求 macOS、Linux 或 WSL,并需要 Node.js 22 及以上版本。安装脚本不会使用 sudo,开发者可以在执行前查看脚本内容。
验证清单本身,已经在帮助开发者
在实际使用中,这位开发者总结了几点经验。首先,仅仅把检查项写下来,就已经产生了很大价值:清单会促使他更仔细地测试,即使还没有开始标记结果。其次,简短备注往往比长篇描述更有效,例如“Safari 上页面空白”这样的信息,足以让 AI 获得明确线索。
他还提到,问号状态经常被低估。在他标记过的 ? 项目中,约有一半并不是 bug,而是自己没有理解 AI 的实现方式。
目前,palmtop 免费使用,不需要注册账号,由作者利用个人业余时间开发。他表示,现在最需要的是来自其他开发者的反馈,尤其是“哪里会出问题”。此前已有 Reddit 用户建议为失败检查项附加截图,这一功能也已列入计划。
对越来越多依赖 AI 编程助手的团队和独立开发者来说,这类工具指向了一个正在浮现的问题:当代码生成速度越来越快,开发流程中的瓶颈正在从“写代码”转向“验证代码”。如何让 AI 的输出变成可追踪、可复查、可反馈的检查项,可能成为下一阶段 AI 编程工具的重要竞争点。
原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/ai-bian-cheng-zhu-shou-shuo-ta-gai-hao-le-ni-zen-me-que-ren