PetGen

用桌宠改善代码评审心情?一次开发者实验

2026-10-07

七个人、两周、每人一只桌宠:评审里的评论数怎么变、哪些指标一动不动,以及你自己的开发者幸福感实验该怎么跑。

桌宠能改变什么,改变不了什么

桌宠不会读你的 diff,也不会提醒你漏了测试。它能做的事很窄:你读别人代码的时候它就在桌面上,让评审里那些平淡又有点紧绷的时刻有个落脚的地方。这到底有没有用?我们拿一个团队做了两周开发者幸福感实验。

结论很短:评审串变短了,措辞也没那么冲。没有谁因此变成更好的工程师。如果你指望有什么东西能让代码评审变得愉快,那不是桌宠。

实验是怎么搭的

一个产品团队七个人,同一个仓库,都用 Codex。每人从自己挑的照片生成一只像素桌宠装好,然后约定一条:评审流程一个字都不改。同一份 checklist、同样的响应时限、同样的评审人。

每条 PR 我们记三件事:一共多少条评论、其中多少条是在抠风格而不是讲实质、以及作者读完反馈后自评的 1 到 5 分心情分。第三个数字是自己填的,偏软;前两个不是。

  • 基线周:不装桌宠,41 条 PR
  • 实验周:装桌宠,38 条 PR
  • 两周用同一份评审 checklist 和同一批评审人
  • 心情分在读完反馈十分钟内填,不靠回忆补

数据长什么样

每条 PR 的评论数从 6.4 降到 5.1。只谈风格的评论,就是那些以 nit 开头、最后总要多走一轮的,从每条 2.3 降到 1.2。自评心情分从 3.1 走到 3.6,方向是真的,幅度小到我们不会单独拿它下结论。

响应耗时没动,发现的缺陷数也没动。变的是评审时的感受,不是评审能抓到什么。

  • 每条 PR 评论数:基线 6.4,装桌宠后 5.1
  • 只谈风格的评论:基线 2.3,装桌宠后 1.2
  • 读完反馈的自评心情:3.1 到 3.6(满分 5)
  • 首次评审耗时:两周都在四小时左右,没变
  • 七人中有两人说完全没感觉

哪些时候有用,哪些时候白搭

效果集中在一个瞬间:你点开一条有二十条评论的评审的那一下。人就是在那里写出事后后悔的回复。桌宠不解决评审本身,它只是在你想好怎么说之前,往屏幕角落里放一个安静、可预期的东西。

对本来就喜欢评审的人没用,对头三天觉得碍事、直接把它挪出屏幕的两个人也没用。

  • 有用:反馈很长,你想缓一下再回复的时候
  • 有用:连着读别人代码读了四个小时的那几天
  • 白搭:评审内容本身写得不清楚的时候
  • 帮倒忙:桌宠压在你的 diff 上,所以别摆在编辑器旁边

自己跑一遍这个实验

两周足够看出点东西,也短到没人会抱怨。选一个仓库,流程保持原样,每周末把数字写下来,别到最后凭印象估。

  • 每人各生成一只,不要共用一个伙伴
  • 装之前先统计一轮每条 PR 的评论数
  • 两周的评审 checklist 保持一致
  • 心情分当场记,别等到周五靠回忆补
  • 有人觉得碍事就停,这个结果也算数

下一轮评审就试试

从 / 开始,用任意一张照片生成一只桌宠;为什么这类陪伴留得下来,可以看 /blog/why-developers-love-desktop-companions;套餐次数在 /pricing。桌宠装完不显示的话,/blog/codex-pet-not-showing-fixes 里有常见原因清单。一切都从 codexpetgenerator.com 开始。

Frequently asked questions

桌宠真的能提升代码评审的质量吗?

不能。这两周里它改变的是评审时的感受和每条 PR 的评论数,缺陷数和首次评审耗时基本没动。把它当成让自己舒服一点的东西,别当成质量关卡。

装了多久才会有效果?

三四天。七个人里有两个头两天觉得碍事,把它挪走之后才稳定下来。过了一周还是觉得烦,就关掉,这个结论同样算数。

看 diff 的时候桌宠会不会分心?

会,所以摆位比选哪只桌宠更重要。放在离编辑器远一点的角落。我们这组里把它摆在 diff 旁边的人,最后都把它关了。

一个人能做这个实验吗?

能,只是数据会弱一些。一个人照样可以统计两周内每条 PR 的评论数;心情分只有你自己在打,那就要每次都用同一个标准记,别凭印象补。

Related posts

Share this article:

Try it yourself

Ready to turn your own photo into a pixel-art pet? Upload it on PetGen and get your spritesheet + pet.json in minutes.

Generate your pet now →