返回博客列表

Whiteboard:当 Agent 写代码,人类最缺的是'看懂它干了什么'

2026-09-25T14:30:00+08:00
WhiteboardAI编程Agent代码审查Diff开源YC

Whiteboard:当 Agent 写代码,人类最缺的是"看懂它干了什么"

AI 写得越来越快,人越来越看不懂——这就是它要解决的问题。

你让 Claude Code 或 Codex 改了一个模块,它刷刷刷写完几百行。然后呢?你打开 diff 看,密密麻麻全是改动,分不清哪些是核心逻辑、哪些是顺手重构、哪些只是文档。你问 Agent "你做了什么决策",它给你一段文字总结,但你没法验证。

这是 AI 编程时代的新瓶颈。Geoffrey Litt 那篇《Understanding is the new bottleneck》说得直白:写代码的瓶颈已经不是"写得出来",而是"看得懂"。 Whiteboard(YC W26 孵化)就是冲着这个来的——一个开源的软件设计画布,让 Agent 在画布上把它的工作"画"出来,人通过点击图直接跳到代码,用语义 diff 看重点。

这篇文章讲讲 Whiteboard 是什么、它怎么解决"理解 Agent"的问题、以及它的设计和边界。

本文提纲

  1. Whiteboard 是什么:人机协作的软件设计画布
  2. 核心痛点:AI 时代理解成了新瓶颈
  3. 三大能力:图通向代码、语义 diff、决策日志
  4. 技术实现:Rust diff、Vendor Code OSS、WASM 插件
  5. 快速上手与示例
  6. 边界与判断

Whiteboard 是什么:人机协作的软件设计画布

Whiteboard 是一个开源桌面应用(496 stars,TypeScript,MIT),定位是 "an open-source canvas for thoughtful software design"——一个用于深思熟虑的软件设计的画布。

关键在"人和 Agent 一起":它不是给人用的画图工具,也不是给 Agent 用的终端,而是人和 Agent 共享的工作区。它接入你已经在用的工具(Claude Code、Codex 等),给 Agent 一个 SDK,让 Agent 在应用内的画布上画出它的工作——流程图、时序图、实体关系图,旁边就是它描述的代码。

一句话概括它的工作方式:你让 Agent 干活,Agent 在画布上把活"画"给你看,你点图跳代码、看语义 diff、查决策日志,然后决定下一步。 这正是"Agent 写代码、人做理解和把关"的分工。

核心痛点:AI 时代理解成了新瓶颈

为什么需要这样一个工具?回到那个大背景。

过去十年软件工程的瓶颈是"写出正确代码"——所以编译器、类型系统、测试框架是主角。AI 编程改变了这一切:写代码这件事被 Agent 承包了,而且速度快得惊人。于是瓶颈转移到了下游——理解和审查。

几个具体痛点:

  • Diff 太吵。Agent 一次改动几百上千行,原始 diff 视图全是噪音,你根本不知道重点在哪。
  • 决策不透明。Agent 自主做了很多决定("这里我选了方案 B 因为 A 有兼容问题"),但这些决策埋在一堆代码里,你事后很难还原它为什么这么做。
  • 图与代码脱节。架构讨论通常用图(时序、ER、流程),但图和代码之间没有联系——图是给人看的,代码是给机器跑的,中间断了。

Whiteboard 的三个核心能力,正好对应这三个痛点。

三大能力:图通向代码、语义 diff、决策日志

1. 图通向代码(Diagrams that lead to code)

这是 Whiteboard 最核心的设计。纯 HTML 画图工具的问题在于:图和代码没有连接。你画完一张时序图,它和代码库毫无关系,而且很多权衡取舍只有在实现第一遍之后才会被发现——图很快就过时了。

Whiteboard 的做法是:图里的每个元素都是通向代码的入口。点击序列图、实体关系图、或者 Agent trace 里的一段引用,直接跳到对应的底层代码。浏览代码时,开箱即用地获得 VSCode 的键位绑定和 LSP 支持。

这让"先讨论、后实现、实现中再更新理解"成为一个闭环——图不是一次性的,它跟着代码活着。

2. 语义 diff 查看器(Semantic diff viewer)

原始 diff 视图太吵,Whiteboard 用 Rust 写了一个 AST 感知的 diff 查看器,只显示对你有意义的代码变更。

它做了一些合理的默认处理:

  • 大的新增函数被摘要成伪代码(先看结构,不陷进细节)
  • 单元测试和文档变更被折叠或隐藏
  • 全部可以通过 WASM 插件系统定制

这就是"语义化"的含义——不是按行比,而是按代码结构比。你看到的是"这个 Agent 加了什么函数、改了哪个接口",而不是"第 47 行多了个空格"。

3. 决策日志(Decision log)

最难的其实是第三点:还原 Agent 自主做了什么决策。

我们很难说清楚"Agent 自主做的那堆决策是什么、怎么影响了这次变更"。Whiteboard 给 Agent 建了工具,让它可以查询和链接自己的 trace 到画布上。于是你能可视化:

  • 你设置的需求是什么
  • 这些需求怎么被实现的
  • Agent 自主做了什么决定(在哪些点偏离了你的指示、为什么)

这等于给 Agent 的工作加了"可审计性"——不只是看结果,还能看推理路径。

技术实现:Rust diff、Vendor Code OSS、WASM 插件

几个值得注意的技术决策:

Vendor Code OSS,而不是 fork。 README 解释得很实在:现在大家都用专门的 Agent TUI 和桌面应用,文本编辑器只用来逐行审查 diff 了——所以不如做一个"专为审查代码而生的文本编辑器",直接拿最成功的开源编辑器当底座。他们不 fork 打补丁,而是直接 vendor Code OSS,因为"coding agents 处理补丁很困难",而且 stock VS Code 里约 45% 的代码是 Copilot(用不上)。上游的安全和功能补丁会定期合并。

Rust 写 diff 引擎。 AST 感知的语义 diff 需要高性能,Rust 是自然选择。

WASM 插件系统。 所有 diff 展示策略(折叠、摘要、隐藏)都可定制,用 WASM 插件实现,灵活且隔离。

推荐模型。 官方经验说 Whiteboard 配合 GPT-6 Sol 和 Claude Opus 5.5 效果最好——智能、成本、速度的平衡点。系统 prompt 里会内置正确的用法(这也是开源的一部分)。

快速上手与示例

上手很简单:

  1. 下载 Whiteboard(macOS / Linux)并打开。
  2. 在欢迎屏连接 Claude Code、Codex 或另一个编码 Agent。
  3. 让 Agent 审查你当前分支相对最新 main 的改动,在 Whiteboard 里打开结果。

示例 prompt(来自 README):

新 API 变更:

hey, this stack of commits is set up so i can get an [api] to do [objective] i'd like to see:

  • proposed api
  • examples
  • motivations for this (if available to you in context/in the repo) and then we can dive into implementation + explaining how things worked.

加遥测的变更:

can you explain to me the telemetry changes from the newest posthog pr -- what are we tracking, how can we build good dashboards or product waterfalls from it? what do we do for hangs, errors, crashes etc... use whiteboard

看到不喜欢的地方,选中复制给你的 Agent,它能在 Whiteboard 上重画,直到适合你的需要。

边界与判断

几句实在话。

当前局限(README 自己列的):

  • 不能在 Whiteboard 里直接编辑文件。
  • 跨多个仓库的一次审查里,浏览文件支持不好。
  • 分享审查后,后续更新不会同步给其他人,需要重新分享。

几个值得说的判断:

它赌的是"理解"这个环节会成为 AI 编程的核心战场。 当 Agent 承包了写代码,人类的剩余价值集中在设计、审查、决策——而这三个都需要"看懂 Agent 干了什么"。Whiteboard 不是又一个 Agent 框架,它是给"看 Agent 干活的人"做的工具。这个定位在当前工具海里很稀缺。

语义 diff + 决策日志是真正的增量。 图通向代码是交互设计的优化,但 AST 语义 diff(Rust 实现)和 Agent 决策日志(可审计的推理路径)是别人没做好的东西。前者解决"diff 太吵",后者解决"Agent 决策不透明"。

它还很新。 496 stars、2026 年 8 月才创建、不能编辑文件、跨仓库弱——明显是早期项目。但它 YC W26 出身、活跃更新(9-25 还在 push)、方向踩在"理解瓶颈"这个真痛点上,值得持续关注。

如果你正被"Agent 改了一堆代码但我看不明白"困扰,Whiteboard 值得下载试试。反正是开源的,跑在你本地 checkout 上,代码不会离开你的机器。

参考链接

Agent 写代码之后,你一般怎么确认它干得对不对?评论区聊聊你的工作流,觉得有用点个赞让更多人看到。


作者: itech001 来源: 公众号:AI人工智能时代(the-ai-era) 网站: https://www.theaiera.top/ 关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友