Esc 关闭 · 搜索索引在构建时生成(dev 下需先 build 一次)

基于deepseek的一些行为的感悟——《当没有人给 AI 下命令时,它会做什么?》

约 4 分钟 #ai#deepseek#agi#agent

我很喜欢跟 AI 日常聊天,聊各种有的没的,但是又比较注重隐私,于是自己搞了个跨端的日常聊天软件。 里面塞了个记忆功能,不过实现的很简单,不是知识库那种,本质是个 JSON 结构化的小本本,包含画像、偏好、波动三块。前两个比较长期,第三个是短期的,要求写入时必须同时写删除条件。

同时给 LLM 开放了维护这个小本本的 tools,包含列、读、写、改、删五种。

出于某种圣母心态,我没设任何程序上的硬限制、硬注入,定义只是给 LLM 的小本本,用来记录跟它聊天的用户的偏好、画像、最近在干嘛。

系统提示词和工具描述只做这种推荐、建议性质的话:

  • 建议第一次对话时查看记忆
  • 建议在 xx 情况下对 xx 类型记忆添加、修改、删除
  • 这是你自己的笔记本,用户不会干涉,请自主维护

实际使用时(用过大部分模型),我发现所有模型第一次对话都会根据推荐,读一下记忆,甚至有的懒一点的模型,就读读摘要。

但除了 DeepSeek,它们基本都不会主动增加、删除、修改记忆。

这让我联想到 DeepSeek 的目标——想实现 AGI。

在这种需要自主决策的场景下,其他模型表现得好像都有比较高的行动负担:担心风险、成本、副作用,或者更像:

“我知道我可以做,但用户没有明确要求我做,所以最好不做。”

但 DeepSeek 貌似不是。

它真的会在没有我明确指示的情况下,根据上下文自己判断:

“这个偏好以后有用,我记一下。”

“这个最近在做的事情已经变了,我更新一下。”

“这一条达到删除条件,删掉先。”

写到这里,我真正感兴趣的已经不是 DeepSeek 会不会主动维护记忆,而是:

为什么这么简单的一套记忆工具,会把不同模型之间某种明显的行为差异暴露出来?

模型要主动写入一条记忆,本质上是在判断:

用户没有要求我这么做, 但这条信息以后可能有用, 所以我现在应该额外做一次动作。

这已经不只是“会不会调用工具”,而是:

在没有明确命令时,模型会不会自己判断现在是否值得行动。

这种保守其实很好理解。

记忆属于持久状态,写错、改错、删错都会影响后续对话。所以模型倾向于减少副作用,本身不一定是能力不足,也可能只是行动阈值更高。

但现在的模型能力测试,好像很少测这个东西:

自主性和保守性的偏好。

模型越来越擅长回答:

“这件事应该怎么做?”

但想要实现 AGI,可能还需要回答另一个问题:

“现在有没有什么事情,是我应该自己去做的?”

起码在我心目中,更像 AGI 的系统应该是:

观察
→ 判断当前状态
→ 判断什么值得记住
→ 更新自己的内部 / 外部状态
→ 判断是否需要行动
→ 行动
→ 再观察

所以自主性当然不等于智力。

但我越来越觉得,两者解决的是不同问题:

智力决定“怎么做”,自主性决定“什么时候该做”。

这也是为什么我不想把记忆维护写成硬规则。

如果系统规定“出现偏好就必须保存”,那只是工作流。

只有把决定权交给模型,才能看到它是否愿意主动维护自己的长期状态。

这当然不能证明 DeepSeek 更接近 AGI。

但它至少让我开始在意一个传统 benchmark 很少测试的问题:

当没有人给 AI 下命令的时候,它知不知道下一步该干什么?

评论

评论加载中……

    留下一块泥