添加新评论

模型不懂你们公司

前段时间看到 Databricks 的 CEO Ali Ghodsi 接受采访,说了一句让我停下来的话:"模型缺乏组织内部上下文。"

这句话击中了一个我隐约感觉到、但一直没想清楚的问题。我们团队从去年开始在各种场景里接入 AI,踩了不少坑。回头复盘,大部分失败不是因为模型不够强,而是因为模型根本不知道"我们公司是怎么回事"。

一、上下文这件事,被严重低估了

大部分团队在评估 AI 工具时,关注的是模型本身的参数大小、benchmark 得分、响应速度。但这些指标衡量的是"通用智力",就像你招一个新人,学历和智商都很高,但他不知道你们公司的业务怎么跑、决策怎么流转、谁说了算、哪些事不能碰。

组织上下文包含很多层:显性知识(文档、流程、架构),隐性知识(为什么当初选了这个方案、哪些历史包袱不能碰、谁是真正的决策者),还有那些"只可意会"的东西(团队默契、政治边界、文化惯性)。

模型能处理第一层,勉强触及第二层,对第三层几乎无能为力。

二、三个真实场景

第一个场景:我们试过用 AI 做代码审查辅助。通用模型审查代码质量没问题,但它不知道这个模块当初为什么写成这样——是因为合规要求,还是因为历史遗留,还是因为某个大客户有特殊需求。结果它提的建议有三分之一是"正确的废话",另外三分之一是"技术上对但业务上不能改"。

第二个场景:一个朋友的公司用 AI 做客服知识库问答。上线第一周用户满意度反而降了。后来发现,AI 给出的答案在技术上是准确的,但跟公司实际的处理流程不匹配。用户按照 AI 的建议去操作,走到了死胡同。

第三个场景更典型:某金融公司让 AI 辅助写产品文档。生成速度很快,但措辞不符合监管要求,风险提示的颗粒度不对,关键条款的表述有歧义。这些事,一个做了三年的产品经理闭着眼睛都知道,但模型不知道。

三、为什么 RAG 也解决不了

很多人的第一反应是:"用 RAG 啊,把公司文档喂进去不就行了?"

我也这么想过。后来发现,组织上下文中最有价值的部分,恰恰是那些没有被写进文档的东西。为什么这个 API 的命名规范跟其他模块不一样?因为三年前做这个模块的人已经离职了,而接手的人不敢改。为什么某个配置项永远不能设成 true?因为有一次设了之后整个支付链路挂了半天。

这些东西存在于人的脑子里、团队的 Slack 历史里、某次会议的口头约定里。它们不会被写进 Confluence,但它们决定了"在这家公司,事情是怎么运转的"。

Anthropic 做过一个实验,给检索的每个 chunk 前面加一段上下文说明,检索失败率降了将近一半。这说明什么?说明连模型自己都知道,光看原文不够,它需要"上下文"来理解上下文。

四、技术管理者的新角色:上下文架构师

如果认同这个判断,那技术管理者需要重新思考自己的角色。

过去我们的工作是搭建系统、管理团队、做技术决策。但在 AI 工具越来越强的环境下,有一件事变得比以前重要得多:把组织上下文结构化,让 AI 能用。

这不是传统的"知识管理"。知识管理是把文档整理好让人能找到,而上下文工程是把隐性知识显性化、让机器能理解。难度完全不同。

举个例子:你的团队有一套代码审查规范,写在 Wiki 上。但真正影响审查结果的那些潜规则——"这个模块的 owner 对性能有洁癖"、"那段代码虽然丑但别动,因为老板看过"、"这个 PR 虽然没跑通测试但可以放行因为客户催得急"——这些规则没有被记录下来,但每天都在影响决策。

把这些东西沉淀下来,不是写文档那么简单。它需要你理解每个决策背后的"为什么",并且找到一种方式让 AI 也能理解这个"为什么"。

五、这意味着什么

对于技术管理者来说,至少有两个直接影响。

第一个:你的上下文理解能力正在变成稀缺资源。当所有人都能调用同一个模型时,差异化不在于谁用了更强的模型,而在于谁能更好地把组织知识喂给模型。这件事做得好的人,交付效率可能是做得差的人的两到三倍。这不是夸张,是我们团队内部的真实数据。

第二个:AI 工具的内部化程度,决定了它的投资回报。买一个通用 SaaS 工具,跟基于自己公司的上下文做定制化,效果差距巨大。但定制化意味着更高的投入和更长的周期。这个投入值不值?我认为在大多数场景里是值的,因为通用工具带来的效率提升往往会被"不懂上下文"带来的返工和修正吃掉。

六、还没想明白的部分

写到这儿,有个问题我自己也没答案:上下文工程的边界在哪里?

你不能把公司里所有的隐性知识都显性化——有些东西一旦被写下来就会失去意义(比如"某些规则其实可以不遵守"),有些东西写下来会有风险(比如非正式的决策惯例)。而且组织上下文是动态的,今天的默契明天可能就变了。

所以也许更好的问题不是"怎么把所有上下文给 AI",而是"怎么让 AI 知道自己不知道什么"。让它在不确定的时候说"我不确定,建议你问一下某某",而不是自信地给出一个在技术层面正确但在组织层面错误的回答。

这个方向目前还没有成熟的解决方案,但我观察到已经有一些团队在尝试给 AI 加"置信度阈值"——低于阈值的回答自动转人工。思路是对的,但颗粒度还不够。未来可能需要按领域、按场景、按决策影响面来动态调整这个阈值。

Ali Ghodsi 那句话的后半句其实也值得想想:"模型缺乏组织内部上下文"——这不只是一个技术挑战,更是一个组织设计问题。你怎么组织你的知识,决定了你能从 AI 那里拿到多少价值。

这个问题,我自己也还在想。可能半年后回来看,会觉得今天的判断有一半是错的。但至少目前的方向感是清晰的:模型越来越强,但组织上下文这个瓶颈,短期内不会消失。

You voted 5. Total votes: 17