Phase 5:视觉 Agent 收口(两线合一)

用大白话说:这一页帮你搞懂「怎么让 AI 助手来当你视频系统的管家」。

目标很简单:把 Phase 4 里那个 agent 拿过来,让它去指挥、盯着你的视觉管线。

打个比方。你的视频检测系统是一条流水线,agent 就是站在旁边的车间主任。 它能问「现在画面里有几个人」,也能喊「这一路卡住了,重启」。

这是整条学习路线的终点。走到这儿,你就不再只是「会写视觉」或者「会写 agent」的人了, 而是「能用 agent 来编排一整套视觉系统」的人。这种复合能力,市场上最缺。

一、为什么合流

因为两条线你都已经有底子了,就差捅破最后一层窗户纸。

视觉这条线你会:实时推流(说人话:把画面像直播一样传出去)、TensorRT 量化(说人话:给模型减肥、让显卡跑更快)、多路同时跑、小目标优化。 Agent 这条线你会:循环、工具、记忆、RAG(说人话:答题前先翻资料)。

合流要做的事其实就一句话: 把视觉系统的每个能力,包成一个「工具」给 agent 用,剩下的交给它去调度。

二、可做的 Demo(由易到难)

下面四个 demo,从最简单的问答开始往上爬。你先做第一个,跑通了再往下走。 看这张表的方法:左边是你对 agent 说的话,右边是你要提前写好、挂给它用的那个函数。

做什么 Demo你会对 agent 说什么你要给它准备的工具
问答「画面里谁没戴安全帽?」get_detections() 返回当前帧检测
动态调参「高空误检多,把 conf 调高」set_conf(threshold)
自愈「推流卡了,重启一路」restart_stream(id)
复盘「今天哪路漏检最多?」get_metrics() 返回分域评测

三、怎么搭(复用 Phase 4 骨架)

不用重写,你把 Phase 4 那个骨架直接搬过来,只换掉工具表就行。 下面这段就是把「计算器」换成了你自己系统里的四个开关。

tools = {
  "get_detections": lambda: 当前帧检测结果,
  "set_conf":       lambda t: 改管线 conf 阈值,
  "restart_stream": lambda id: 重启指定路,
  "get_metrics":    lambda: 返回分域 AP/FPPI,
}
# 记忆 = 对话历史;RAG = 检索你的 ARCHITECTURE.md / 优化清单
# 循环 = Phase4 的 while;模型 = Hermes / 任意 LLM
一个值得琢磨的点:agent 去改 conf、去重启某一路,本质上是在拧你 Phase 0 里拆出来的那些旋钮和线程。 所以你对自己系统理解得越透,能交给 agent 的工具就越靠谱、越好用。 这就是两条线互相加分的地方。

四、收口后的能力画像

都做完之后,你面试时可以这样介绍自己。下面这段话,每一句背后都是你真跑过的东西。

「我搭过生产级实时视觉推理管线(ffmpeg 拉推流 + TensorRT 量化 + 多路并发),能压住延迟并保小目标精度;同时写过能编排这条管线的 agent,把视觉能力暴露成工具。两端都自己读码、自己调优,不靠黑箱。」

这段话 = 视觉部署 + Agent 双修。 它正好对上市场最缺的那五项能力:界定问题、读码定位、领域纵深、生产落地、取舍判断。

五、🔧 Phase 5 验收

下面三条做到,整条路线就算走完了。

回到 总览 复习心法,或看 后续优化清单 把学习排进周计划。