用桌宠改善代码评审心情?一次开发者实验
2026-10-07
七个人、两周、每人一只桌宠:评审里的评论数怎么变、哪些指标一动不动,以及你自己的开发者幸福感实验该怎么跑。
桌宠能改变什么,改变不了什么
桌宠不会读你的 diff,也不会提醒你漏了测试。它能做的事很窄:你读别人代码的时候它就在桌面上,让评审里那些平淡又有点紧绷的时刻有个落脚的地方。这到底有没有用?我们拿一个团队做了两周开发者幸福感实验。
结论很短:评审串变短了,措辞也没那么冲。没有谁因此变成更好的工程师。如果你指望有什么东西能让代码评审变得愉快,那不是桌宠。
实验是怎么搭的
一个产品团队七个人,同一个仓库,都用 Codex。每人从自己挑的照片生成一只像素桌宠装好,然后约定一条:评审流程一个字都不改。同一份 checklist、同样的响应时限、同样的评审人。
每条 PR 我们记三件事:一共多少条评论、其中多少条是在抠风格而不是讲实质、以及作者读完反馈后自评的 1 到 5 分心情分。第三个数字是自己填的,偏软;前两个不是。
- 基线周:不装桌宠,41 条 PR
- 实验周:装桌宠,38 条 PR
- 两周用同一份评审 checklist 和同一批评审人
- 心情分在读完反馈十分钟内填,不靠回忆补
数据长什么样
每条 PR 的评论数从 6.4 降到 5.1。只谈风格的评论,就是那些以 nit 开头、最后总要多走一轮的,从每条 2.3 降到 1.2。自评心情分从 3.1 走到 3.6,方向是真的,幅度小到我们不会单独拿它下结论。
响应耗时没动,发现的缺陷数也没动。变的是评审时的感受,不是评审能抓到什么。
- 每条 PR 评论数:基线 6.4,装桌宠后 5.1
- 只谈风格的评论:基线 2.3,装桌宠后 1.2
- 读完反馈的自评心情:3.1 到 3.6(满分 5)
- 首次评审耗时:两周都在四小时左右,没变
- 七人中有两人说完全没感觉
哪些时候有用,哪些时候白搭
效果集中在一个瞬间:你点开一条有二十条评论的评审的那一下。人就是在那里写出事后后悔的回复。桌宠不解决评审本身,它只是在你想好怎么说之前,往屏幕角落里放一个安静、可预期的东西。
对本来就喜欢评审的人没用,对头三天觉得碍事、直接把它挪出屏幕的两个人也没用。
- 有用:反馈很长,你想缓一下再回复的时候
- 有用:连着读别人代码读了四个小时的那几天
- 白搭:评审内容本身写得不清楚的时候
- 帮倒忙:桌宠压在你的 diff 上,所以别摆在编辑器旁边
自己跑一遍这个实验
两周足够看出点东西,也短到没人会抱怨。选一个仓库,流程保持原样,每周末把数字写下来,别到最后凭印象估。
- 每人各生成一只,不要共用一个伙伴
- 装之前先统计一轮每条 PR 的评论数
- 两周的评审 checklist 保持一致
- 心情分当场记,别等到周五靠回忆补
- 有人觉得碍事就停,这个结果也算数
下一轮评审就试试
从 / 开始,用任意一张照片生成一只桌宠;为什么这类陪伴留得下来,可以看 /blog/why-developers-love-desktop-companions;套餐次数在 /pricing。桌宠装完不显示的话,/blog/codex-pet-not-showing-fixes 里有常见原因清单。一切都从 codexpetgenerator.com 开始。
Frequently asked questions
桌宠真的能提升代码评审的质量吗?
不能。这两周里它改变的是评审时的感受和每条 PR 的评论数,缺陷数和首次评审耗时基本没动。把它当成让自己舒服一点的东西,别当成质量关卡。
装了多久才会有效果?
三四天。七个人里有两个头两天觉得碍事,把它挪走之后才稳定下来。过了一周还是觉得烦,就关掉,这个结论同样算数。
看 diff 的时候桌宠会不会分心?
会,所以摆位比选哪只桌宠更重要。放在离编辑器远一点的角落。我们这组里把它摆在 diff 旁边的人,最后都把它关了。
一个人能做这个实验吗?
能,只是数据会弱一些。一个人照样可以统计两周内每条 PR 的评论数;心情分只有你自己在打,那就要每次都用同一个标准记,别凭印象补。
Related posts
Try it yourself
Ready to turn your own photo into a pixel-art pet? Upload it on PetGen and get your spritesheet + pet.json in minutes.
Generate your pet now →