AI Coding的下一站,不是更会写代码,而是更懂团队

AI Coding的下一站,不是更会写代码,而是更懂团队
个人 AI Coding 的效率提升已无悬念但团队规模铺开后一个更深的短板暴露了每次 session 踩坑、纠偏产出的有效经验session 结束即归零。业界在 Agent 经验管理上的探索多聚焦个人记忆而要打破AI每次进项目都从零开始的循环需要的是一套能持续捕获、提纯、沉淀团队经验让AI带着项目语境进场的系统。本文分享从 0 到 1 建设这套系统的完整过程——从初版 90% 候选经验为废料的起点到打磨出 Review/Dedup/Merge 三层治理链路每一步踩在真实问题上的演化路径以及驱动策略设计的实验数据和可复用方法论。一、“别那么干这个 hook 不能同步上报”这是半年前的一次 CodeBuddy session。当时我们在开发一个 stop hook 的上报功能AI 很自然地给出了同步上报的实现——合理绝大多数上报场景同步就够了。我们 review 代码时改了必须异步否则 stop hook 会阻塞进程后续操作直接超时。AI 根据反馈修正了代码session 正常结束。问题出在结束之后。一周后另一个同事的 session 触发了同样的场景。AI 没有那次 session 的上下文给出的仍然是同步上报。同事不是那块代码的原始开发者review 时没有发现这个陷阱。代码合入了直到测试环境才暴露——stop hook 场景下进程阻塞一连串超时错误。 这就是经验断层。不是 AI 不行——它在自己的 session 里被纠正过一次做得很好。但那次纠正只在发起那轮 session 的开发者脑子里AI 完全不记得发生过什么。更普遍地看我们团队在持续深入使用 AI Coding 一段时间后陆续碰到四类这类问题经验即抛一次 session 反复纠偏踩出来的路径session 结束就清零。下一个同事碰同样问题AI 又是零基础起步。重复踩坑项目的隐性约束——“这个目录下的代码访问第三方服务需要走特殊代理”“模块间开关引用不能直接用字符串参数因为开关使用时机问题会导致永远默认关”——这些规则写在 git blame 里但从来不进文档。换个人、换个 session很大概率照踩不误。知识碎片化老同事脑子里有一套这么做才对的 pattern但没人有动力写下来。文档永远跟不上代码变更的速度。到了 AI 时代靠的不是知识管理是靠运气——这次 session 的上下文恰好覆盖了上次的历史就对了没覆盖就错了。AI 永远是新同事AI 不分项目。进新模块不知道架构边界在哪不知道历史包袱是什么也不知道团队踩过什么坑。它不缺编码能力缺的是这个团队的语境。所以整个事情的起点不是怎么让 AI 写代码更快而要打破AI每次进项目都从零开始的循环这需要的是一套能持续捕获、提纯、沉淀团队经验让AI带着项目语境进场的系统。二、初版翻车90% 的产出不可用我们最初的方案非常直白。利用 CodeBuddy 的 Plugin Hook上报所有的研发对话。然后让 AI 读这些对话自动提取经验。Prompt 核心就一句话“提取你认为有价值的内容”——边界的判断、排除规则全交给模型。逻辑上说得通对话里反正有信息模型也足够聪明。整条链路只有两步对话上报 → 经验抽取 → 入库上线后我们很快发现产出的经验里大约 90% 是废经验无法让后续工作更顺畅。这个废不是主观评价是拿被召回后 Agent 的行为是否发生正向改变当标准来衡量的。而且废不是一种废是四层结构性问题叠加在一起第一层噪声极高。 原始对话包含大量调试过程——“继续”“重试一下”“不行换个方式”——以及遍地的失败路径。这些不是经验是过程录像。模型不加区分地全抽出来了。比如系统某次抽出一条多试几次就好了——这是在碰运气不是在沉淀判断。第二层上下文脱离。 抽出来的经验脱离原始语境就失真了。比如有一次系统抽出stop hook 需要异步处理——听起来对但实际上这条规则只适用于特定环节、特定场景。不加限定条件会误导后续 Agent 在所有 hook 场景下无差别异步反而搞出新的 bug。第三层错误引导。 比没经验更糟的是错的经验。一条超时就调大超时参数的经验被抽出来进入库——根因不在这这只是堆补丁。Agent 下次遇到类似问题会优先调参数而不是排查根因系统性走错路。第四层价值难定义。 LLM 的总结能力在开放域很强但放在经验提取里大量产出流于表面。“遇到复杂问题多收集上下文”——这句话永远对但在具体工程场景下基本没有指导意义。AI 看完它不知道下一步该干嘛。这四层问题暴露出一个核心事实过程录像不等于经验。自动提取放大候选集的同时也在同步放大噪声。不加过滤的自动提取就是一个垃圾放大器。 让 AI 自己判断自己产出经验的价值等于让裁判同时当运动员——在工程上无效。三、为什么现成方案行不通翻车之后我们系统性地看了业界在Agent 经验管理方向上的方案。ClaudeCode AutoDream 做的是单会话内自动记忆整理——ExtractMemories 抽取实体/偏好/状态Auto Dream 异步合并。定位是延续单 Agent 上下文把过程记忆当永久记忆存下来。它没有团队边界的意识也不会区分什么值得长期留、什么只是临时状态。Hermes Agent 是 Prompt 驱动的 memory 策略系统。它在特定条件任务成功、踩坑解决触发回顾——解决的是何时记但解决不了记的东西有没有价值。缺乏系统级去重与来源追溯。Mem0 是一套 Agent 长期记忆基础设施。ADD/UPDATE/DELETE/NONE 四类判定、混合检索生命周期管理完整。但整个设计的假设是记忆大体有价值——这个假设在编程场景的高噪声对话里完全站不住。把它们放在一起看共同的局限是聚焦个人记忆追求记住更多。我们需要的是反向的聚焦团队经验质量追求留下更少但更可信——带适用场景、约束边界、来源证据的工程经验。 既然业界没有现成方案我们只能自己摸索。四、什么是团队经验——从 Agent 的视角重新定义经验系统的最终服务对象不是人是 Agent。Agent 的工作方式很明确接收输入包含召回的经验→ 做出决策/产生输出。由此推导判定一条信息是不是经验的标准只有一个被召回后Agent 能否产生正向的行为变更。它把经验从一段有价值的文本锚定到了能否改变 Agent 行为上是一条可实际验证的工程标准。基于这个标准一条合格的团队经验必须同时满足几个条件来自真实对话、有证据支撑、项目特有、不是通用常识、后续相似场景可复用。其中最关键的是 “不容易直接发现”——如果 Agent 自己就能推出来召回它没有任何额外价值。但什么才算不容易直接发现我们按 Agent 理解需求的路径拆成三类黑话镜头语义不可发现 项目内部的黑话、缩写、代称字面上完全无法推导。比如D 站在项目里指盗版站点、A 站指成人站点——AI 只看到字母不知道背后语义。这类名称在对话里反复出现但 AI 永远猜不对。索引镜头位置不可发现 某个工具、目录、能力入口不在直觉路径上。比如直达页面功能在 xhome 模块关键类是 FastCutXXX——读代码找不到需要知道去哪找。逻辑镜头行为不可发现 反直觉的工程约束、隐式机制。开头提到的stop hook 不能同步上报就是典型——AI 常规推理认为上报是轻量操作同步没问题但实际场景有并发阻塞风险。再比如模块间开关引用不能直接用字符串参数——开关确实有 String 参数但用了之后由于开关使用时机的问题导致效果永远为默认关。这种坑常规推断推不出来。这三个镜头不是按主题前端/后端或重要性高/中/低分的——那些维度要么无穷无尽列不完要么依赖主观判断不稳定。认知障碍是客观的一条信息Agent 能不能自己发现可以判定。镜头类型障碍本质典型场景信息缺口黑话镜头语义不可发现D 站字面只是字母 D需要显式映射为盗版站点索引镜头位置不可发现“直达页面功能在哪”需显式指向 xhome 模块 FastCutXXX逻辑镜头行为不可发现stop hook 同步上报AI 常规推理推不出并发阻塞风险五、系统链路被问题逼出来的演化回到实际工程。初版的两步链路能跑通但跑起来后问题一个一个暴露——每个都不是设计时预见的问题 1 原始对话一股脑塞给模型主题混杂、噪声大、上下文溢出。经验不是什么单轮对答就能判断的——需要看失败 → 纠正 → 修复 → 采纳的完整过程。→ 新增 主题分组 环节让模型结合 session 大纲按主题切分片段分组后再逐个提取。 问题 2 仅提取就直接入库约 90% 是垃圾。→ 新增 Review 质量审核 环节入库前设一道质量闸口。 问题 3 不同分组、不同 session 产生重复候选经验。→ 新增 Dedup 候选去重 环节在入库前识别并合并重复。 问题 4 入库后无法长期维护新经验与历史经验的关系是糊涂账。→ 新增 Merge 历史合并 环节判断新经验是新建、更新、跳过还是与历史冲突。整条链路最终收敛为对话上报 → 主题分组 → 经验抽取 → Review → Dedup → Merge → 入库 → 召回统计一个容易被忽视的关键是主题分组。我们试过两组对照一组给分组后的片段额外附上 session 上下文大纲一组不给。带大纲的那组产出了更多垃圾——因为大纲引导模型做泛化推断反而偏离了分组片段里实际发生的具体经验。分组本身的粒度就够了。六、三层治理从能跑到能用链路搭起来只是第一步。真正让系统可靠的是 Review / Dedup / Merge 三层治理。这三层目标不同、策略不同、默认方向也不同但底层驱动方式一致——错例分析 → 规则抽象 → 评测验证。6.1 抽取从识别垃圾到评测驱动在讲三层之前得先说清楚源头——经验抽取这一步本身怎么持续变好。初版证明了能抽出经验但质量参差不齐。好经验很难一次定义到位但垃圾经验的特征更容易归纳。所以我们的做法是 先研究垃圾再反推好经验。经过大量标注归纳出九类典型垃圾特征事实性错误——编造不存在的约束把对话里的临时说法当规则通用常识——任何项目都适用不体现团队特异性对话摘要——只复述过程没有沉淀成可复用判断一次性 case——只对当前任务有效不能迁移用户主观偏好——个人选择不代表团队规范缺少上下文——不知道对应哪个模块/组件/接口粒度混用——一条经验里兼顾通用规则和 case 特定信息不可执行——只有抽象建议Agent 看完不知道怎么做证据不足——对话里没有足够依据模型自己推断过多有了九类特征走两条路径工程化标注路径 对候选经验做价值标注高价值/低价值/垃圾→ 对垃圾做归因 → 归纳垃圾模式 → 转成标注规则和 Reviewer 标准。这条路径的意义是让经验质量从主观感觉变成可讨论、可对齐的对象。形成的评测集会持续用于后续所有 prompt 修改的效果测量。可审计路径 要求模型为每条经验输出三个维度的解释——为什么这是经验解决了什么可复用问题、是否是项目特有、命中了 prompt 中的哪些排除规则通过了哪些垃圾检查、对话证据是什么哪几轮对话支撑。这让模型的判断过程脱离黑盒也为后续 prompt 迭代提供了错例定位的依据。有了这两条路径Prompt 的迭代不再是感觉不太好改一下试试而是有明确的结构化流程固定对话样本 → 当前 prompt 提取 → 与人工标注对齐 → 分析错例 → 修改 prompt → 重新评测 → 对比指标变化三个核心指标一起看Recall 看该提取的提了多少、Precision 看提取的有多少不是垃圾、Garbage Rate 看不该提取的提了多少。不能只看一个——只看 Precision 模型会过度保守只看 Recall 垃圾会变多。目标是同时保持垃圾率下降和整体提取质量不退化。6.2 Review源码探索做事实性校验Review 的定位是在入库前拦住明确垃圾。策略是默认保留、定向过滤——不追求全面收紧只对明确的三类垃圾维度做精准拦截事实性错误/偏好、缺上下文、粒度混用外加一层无经验类别兜底。这一定位背后是风险判断经验系统的首要风险是漏掉好经验大于多放几条边缘经验默认保留能避免 Review 因过于严格误杀高价值内容。Prompt 的裁决框架收敛为四步事实性错误/偏好检查 → 缺上下文检查 → 粒度混用检查 → 无经验类别兜底。经过三轮迭代从整体重构到边界强化到偏好规则硬化垃圾穿透不断改善。但纯文本判断有一个天然局限模型无法验证经验中提到的技术事实是否真实存在。一条真实案例系统抽出一条经验声称 Android 列表开发中对接 FastScrollBar 应使用 attachToQBListView() 方法。从文字上看逻辑自洽——有具体场景、有方法名、有操作指引。纯文本 Review 大概率会放行。但我们引入了源码探索——在代码库中检索 FastScrollBar 的类定义发现该类只有 attachToRecyclerView() 和 attach() 两个方法根本不存在 attachToQBListView()。正确的方法是 FastScrollBarCompat.attachToQBRecyclerView()。经验被标记为事实性错误直接拦截。[Reviewer 候选实体] ──▶ 提取代码线索: FastScrollBar, attachToQBListView │ ▼ Code Explorer 源码定向搜索 [QQBrowser 源码库] ──▶ 匹配 Class FastScrollBar (收敛成功) │ ▼ 成员函数级事实验证 发现: 该类只有 attachToRecyclerView() 和 attach() 两个方法 不存在 attachToQBListView() (正确方法属于 FastScrollBarCompat.attachToQBRecyclerView()) │ ▼ [ 触发 S1_FACTUAL_ERROR 拦截 ]如果这条经验入库Agent 在涉及列表的场景中会按指示调用一个不存在的方法编译失败。更麻烦的是 Agent 会怀疑自己理解有误而不是怀疑经验有问题——陷入反复重试的恶性循环。6.3 Dedup宁严勿宽禁止桥接合并Dedup 的定位是在候选经验集内部识别重复减少后续流程中的冗余判断。这层的核心风险不是漏去重而是误去重——把两条本应独立保留的经验错误合并造成的边界污染是永久性的。因此策略明确为宁严勿宽。几条严格否决规则When 不同不能合——即使结论看起来相似场景不同就是两条不同的经验主结论类型不同不能合——操作建议、风险规避、排查方法之间不能混为一谈局部子机制和完整系统经验不能合——粒度不一致不能互相替代同一技术事实但用途不同不能合——比如同一条 API 既用于性能优化又用于兼容处理不能因为都涉及这个 API就合并最关键的一条是禁止桥接式合并A 和 B 在处理结果上有重叠、B 和 C 也相关不能因此推断 A 和 C 是重复。经验的边界在于适用场景的约束条件语义相似不等于经验等价——一旦桥接式合并把边界不同的经验串联归并边界信息就永久丢失了。在 260 条经验、4 个分组的评测中整体 F1 为 71.79%。但更值得关注的指标是严格重复场景下的表现——What 和 When 均相同的经验Recall 达到了 91.67%。这说明在最核心的去重目标上策略是有效的。漏判主要集中在 What 为包含/相交、When 为不同/相交的边界模糊组合上——这类场景下策略更倾向于保护差异避免贸然合并。值得注意的是这 260 条经验是分 4 批独立进行的batch 之间表现差异明显。最极端的是 batch_004仅识别出 6 个人工正例中的 1 个——该 batch 的正例全部落在非双强一致的组合上。这说明去重 prompt 对边界的敏感度在输入特征分布变化时仍有波动。6.4 Merge唯一目标先行保护历史边界Merge 是入库前的最后一关。它判断一条新经验和历史经验库之间的关系执行四种动作之一create库中不存在同类目标经验新建入库update与历史经验同向但带有实质新信息合并更新skip与新经验在核心结论上可互相替代跳过contradict核心结论直接冲突标记为冲突并提人工裁决策略上有三条主线唯一目标判定前置。 先从历史库中召回与新经验相关的子集判断是否存在唯一最合适的经验目标。如果没有——比如新经验和几条历史经验都沾边但都不属于同一条可维护经验——默认回退到 create。这条规则从根本上避免了强行匹配——一条不够匹配的历史经验被硬推成 update 目标污染边界。Update 必须自检。 对每一笔 update 增加内部 quality_check合并后的 When 是否过度泛化丢失了原经验的场景约束、What 是否保留了最具体、最安全、最可执行的操作建议、Why 是否保留了核心机制、是否引入了不受原始经验支持的新结论。Update 过判是当前最突出的问题—— Recall 高达 96.30% 但 Precision 只有 78.79%。也就是说大部分该 update 的都被识别了但模型存在明显的积极合并倾向把一些本该 create 的内容也判成了 update。Contradict 不自动放过不自动决断。 冲突意味着团队的新认知和旧认知出现了不一致——这本身就是有价值的信号不应该被自动压制。系统只负责标记具体的决策走人工裁决通道。六轮实验、157 个统计样本中整体 F1 达到 94.27%。Create 是最稳定的主类别F1 96.46%模型在没有唯一目标就创建上的判法已经比较可靠。Skip 的 Precision 达到 100%——一旦模型判成了 skip基本都判对但 Recall 只有 85.71%仍有一部分真实 skip 被分流到了 update 或 create。Update 是改进空间最大的类别。七、跑起来之后经过完整的三层治理漏斗我们最终实现了从初版 90% 的抽取垃圾率到治理后 95% 的有效率再到平均 80% 的最终入库率——大量的对话摘要、通用建议、一次性 case、缺乏上下文的碎片内容被扼杀在提取阶段、候选经验再被逐层拦截和合并。截至目前团队经验系统已在 QQ 浏览器团队 6 个仓库中常态化运行覆盖 50 名研发人员的日常开发 session累计采集 1,236 次独立对话。从这些对话中累计提取出 1,022 条候选经验经三层治理最终入库 789 条高置信经验Pipeline 已稳定运行 30 次。7.1 完整的系统运行生命周期以 2026/05/27 日这条 Pipeline 的真实运行案例来看系统如何运作。本次处理原始对话记录数 39 条初步提取候选经验 34 条Review 后被拦截 3 条与历史经验库合并 1条最终入口 30 条其中一条 “ForbiddenController 新增禁用能力须同步改三处” 的候选经验被拦截被识别的原因就是“在罗列修改清单告诉读者去哪里找、改什么而不是在说明隐藏技术事实。”印证了 Review 门禁在精确区分技术事实这条红线上动作准确。而另一条 “Chromium源代码层只能通过hooks层访问UBA功能” 的候选经验则由于表达的是不易察觉的技术事实后果因此被允许通过并入库。在后续与 Agent 协作的开发场景里我们通过 TDev 驱动需求实现的流程时对话内部在特定阶段探索自动触发对历史经验的召回尝试7.2 召回消费复用已有基建在召回这里我们没有重新造轮子而是深度复用了公司已有的知识库平台存储落库三层治理通过后的经验自动写入 IWIKI 经验空间。自动索引Knot 知识库系统实时监听并自动索引 IWIKI 经验内容生成向量与关键词索引。MCP 检索桥接Knot 提供标准 MCP 协议服务。Agent 在 session 期间自动调用 Knot MCP 接口检索相关经验并注入上下文。监控旁路在检索流程中增加了上报旁路实时记录召回成功率和条数。在最新 125 次真实开发检索的召回表现请求级召回率68.8%no_hit未命中仅 4.8%平均每次注入 2.4 条经验平均检索耗时 1,299 ms。这种架构让团队将全部精力集中在最核心的经验提纯与治理上。八、四条可复用的方法论回看整个过程有价值的不是某一个 prompt 怎么写、某一个参数怎么调而是四条从反复踩坑中收敛出来的工程原则。第一条先定义资产边界再做自动化沉淀。 初版 90% 废经验教会我们最核心的一课不定义什么算经验就直接启动自动提取系统会把对话摘要、通用建议、一次性 case 全塞进库。经验系统的关键不是多提取而是高置信地沉淀。在工程化之前必须回答什么算经验、什么不算、判断标准是什么。第二条分层治理别用一个 prompt 解决所有问题。 Review 负责拦垃圾、Dedup 负责候选集内去重、Merge 负责历史库治理——每一层的目标不同、指标不同、prompt 设计也不同。把它们揉在一起各层目标就会互相牵制。用多个针对性模型各自完成一件事比一个通用大模型一次性全搞定更可靠。第三条默认策略要按业务风险分别设计没有统一答案。 Review 默认保留误杀一条高价值经验的代价大于放行两条垃圾、Dedup 宁严勿宽误合并的边界污染不可逆、Merge 保护历史边界已有的经验是已验证的资产新经验要跨过更高门槛才能修改它。宁可错杀和宁可放过的方向在各层完全不同。第四条Prompt 优化要从错例中抽象规则不是凭感觉改。 我们做 prompt 迭代不是这个效果不好改一下试试而是固定的流程收集错例 → 识别误判类型 → 抽象成可操作规则 → 多轮实验验证效果 → 判断规则是否有正向收益。同时用固定评测集防止数据泄露和过拟合。整个链路是工程化的不是手艺活的。结语经验系统从 0 到 1 的建设已经跑通了——链路运转着三层治理上线了召回也在工作。但这只是起点。真正让经验系统从能用走到可靠还有三个环环相扣的方向经验质量生产阶段 当前三层治理生效之后垃圾率降至约 5%。但事实性错误仍难以纯文本识别源码探索只覆盖了部分场景三个镜头之外的边界经验类型还没充分识别评测集规模有限长尾和冷门主题覆盖不全prompt 迭代的边际收益在收窄。使用效率召回阶段 经验已能被召回并注入上下文但命中不等于采纳——目前缺乏观测 Agent 是否真的依据经验改变行为的手段召回侧的唯一目标判定偏粗相似主题下容易出现召回了但用不上。管理维护生命周期 长期未命中、未采纳的经验没有自动淘汰机制库会随时间静默膨胀项目演进时模块重构、能力下线历史经验可能集体失效目前没有自动识别需要复核的能力。三者构成闭环生产决定基线 → 使用暴露问题 → 维护反哺生产。任一环不闭合经验系统就会从资产退回为噪声。最后想说一句经验系统的本质不是技术系统是团队认知能力的工程化管道。过去经验在人脑里、产出在文档里现在经验产生于人与 AI 的对话过程需要一套管道来捕获、提纯、分发。管道一旦建成团队就不再依赖谁在那个时间段在做什么来传承知识——AI 每次进入项目都能带着这个团队积累了什么、在什么场景下该怎么做的语境。这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容

最新新闻

日新闻

周新闻

月新闻