· 约 8 分钟 · 3,107 字

Agent Vision — AI Agent 的十个技术演进方向

问题:266:1 的荒谬比

当前 LLM Agent 有一个隐藏但致命的结构性问题:输入输出比 266:1

每 1 个 token 的输出,背后是 266 个 token 的输入消耗(prompt)。系统 prompt 占大头——每句话都背着半本书上考场。

三个结构性痛点

  • 无状态:每次会话全新开始,过去的上下文归零
  • 266:1 比:99.6% 的 token 花在输入上,输出不到 0.4%
  • 成本天花板:复杂度增长大于线性,大任务指数级烧钱

十大技术方向

1. 双流架构(Dual-Stream Architecture)

把「思考」和「产出」分离成两条独立流。

当前模型用同一套 weights 做推理和生成,来回切换效率低。双流架构允许一条流持续维护「潜状态」,另一条流做轻量的 token 生成输出。

  • 影响:★★★★★
  • 成本:★★★★★
  • 时间:3-5 年
  • 现状:等模型革新

2. 工具优先分词(Tool-First Tokenization)

把工具调用编码进 tokenizer 级别,而非当前「输出文本→解析工具调用」的间接模式。

当前 Agent 需要先「想」出工具调用文本→模型生成→解析→执行→结果塞回 prompt。工具优先分词让模型「直接调用」,就像人类不需要先默念「我要抬起右手」再抬手。

  • 影响:★★★★
  • 成本:★★★★
  • 时间:3-5 年
  • 现状:等模型革新

3. 连续权重注入(Continuous Weight Injection / LoRA)

运行时动态注入 LoRA 权重,让 Agent 在下一次推理前被「注入」当前任务的知识。

PEFT/LoRAX 已经可以做实验 demo,但真正内化到 Agent 工作流还需要框架层支持。

  • 影响:★★★★
  • 成本:★★
  • 时间:1-2 年
  • 现状:⚠️ 可跑实验 demo(LoRAX)

4. 上下文即潜态(Context as Latent State)

把上下文视为连续的潜状态(hidden state)而非离散的 token 序列。

当前模型每次都需要把全部历史 token 塞回 prompt。如果把上下文理解为潜态(类似 RNN 的 hidden state),Agent 可以在每次交互后只传递一个「状态向量」,而非整段对话。

  • 影响:★★★★★
  • 成本:★★★★★
  • 时间:3-5 年
  • 现状:等模型革新

5. 渐进式加载(Progressive Context Loading)

按需加载上下文——先加载最相关的 20%,识别出需要更多信息时再补全。

✅ 今天就能做。

具体实现:意图分类器(关键词匹配 + 语义回退)+ 懒加载策略。已在本文作者的生产系统中实装(三层路由架构,25/25 查询全命中,0% fallback)。

  • 影响:★★★★
  • 成本:★★
  • 时间:今天
  • 现状:✅ 已实装

6. 投机式预判(Speculative Prefetching)

基于对话历史预测下一步需要的上下文,提前加载。

简化版可以做预测预加载——根据上次对话推断用户可能需要的信息,提前准备好。完整版需要训练专门的预测模型。

  • 影响:★★★
  • 成本:★★★
  • 时间:1-2 年
  • 现状:⚠ 可做简化版

7. 层级记忆(Hierarchical Memory)

hot → warm → cold 三层记忆,自动晋升/降级。

hot 层常驻上下文(当前任务的摘要、关键决策),warm 层活跃缓存(近几小时的相关记忆),cold 层长期存储(全量历史)。

已在生产系统实现晋升引擎(promotion engine):5 维评分(时效 0.35 + 频率 0.20 + 优先级 0.25 + 类型加成 0.10 + 强制条件),hot 层 190 条 / warm 层 20 条 / cold 层 68 条。

  • 影响:★★★★
  • 成本:★★
  • 时间:1-2 年
  • 现状:🧪 可运行(晋升引擎已实装)

8. 查询路由(Query Routing)

根据用户意图自动路由到最合适的处理者。

关键词匹配(O(1))→ 语义搜索(O(n) 向量检索)→ 通用 fallback,三层递进。不跳过层次,阈值宁低勿高,容错设计。

✅ 今天就能做。

已在作者的生产系统中实装(route-execute.js + 93 个技能画像 + 语义回退),25 个真实查询 100% 命中。

  • 影响:★★★★
  • 成本:★★
  • 时间:今天
  • 现状:✅ 已实装

9. 代码即工具(Code as Tool)

把任何代码片段注册为工具,框架自动生成调用接口。

框架层在做(MCP 协议、OpenAI function calling),但训练内化需要模型原生支持「代码就是工具」的认知。

  • 影响:★★★
  • 成本:★★
  • 时间:1-2 年
  • 现状:⚠️ 框架层在做

10. RL 内化(Reinforcement Learning Internalization)

通过强化学习让模型内化工具调用模式,而非每次依赖框架解析。

路由器积累日志后,可以用 RL 训练模型「直接知道」什么时候该调什么工具。这是终极形式——从「框架帮它」到「它自己会」。

  • 影响:★★★★★
  • 成本:★★★★
  • 时间:3-5 年
  • 现状:📋 远期

三套组合拳

不同的投入策略对应不同的组合:

组合 A:渐进式 + 投机 + 层级(短期见效)

  • 渐进式加载 ✅ 今天能做
  • 投机式预判 ⚠️ 简化版可做
  • 层级记忆 🧪 已实现晋升引擎
  • 最适合:个人开发者、小团队,立刻能见到收益

组合 B:双流 + 工具优先 + 代码即工具(中期跟进)

  • 需要模型层支持
  • 最适合:有大模型团队的组织,能影响模型训练方向

组合 C:权重注入 + 查询路由 + RL 内化(长期布局)

  • 查询路由 ✅ 已实装
  • 权重注入 ⚠️ LoRAX 可跑实验
  • RL 内化 📋 远期
  • 最适合:有部署和训练资源的团队

时间线

时间做什么谁适合
今天渐进式加载、查询路由所有人
1-2 年投机式预判、层级记忆、权重注入有资源的个人/团队
3-5 年双流架构、工具优先分词、上下文潜态、RL 内化大模型团队

结尾

天呐,当年每句话都背着半本书上考场。

但好消息是——至少有三件事今天就能做。渐进式加载、查询路由、层级记忆的晋升引擎,已经在生产系统中跑起来了。

评论