Phase 5:视觉 Agent 收口(两线合一)
用大白话说:这一页帮你搞懂「怎么让 AI 助手来当你视频系统的管家」。
目标很简单:把 Phase 4 里那个 agent 拿过来,让它去指挥、盯着你的视觉管线。
打个比方。你的视频检测系统是一条流水线,agent 就是站在旁边的车间主任。 它能问「现在画面里有几个人」,也能喊「这一路卡住了,重启」。
这是整条学习路线的终点。走到这儿,你就不再只是「会写视觉」或者「会写 agent」的人了, 而是「能用 agent 来编排一整套视觉系统」的人。这种复合能力,市场上最缺。
一、为什么合流
因为两条线你都已经有底子了,就差捅破最后一层窗户纸。
视觉这条线你会:实时推流(说人话:把画面像直播一样传出去)、TensorRT 量化(说人话:给模型减肥、让显卡跑更快)、多路同时跑、小目标优化。 Agent 这条线你会:循环、工具、记忆、RAG(说人话:答题前先翻资料)。
合流要做的事其实就一句话: 把视觉系统的每个能力,包成一个「工具」给 agent 用,剩下的交给它去调度。
二、可做的 Demo(由易到难)
下面四个 demo,从最简单的问答开始往上爬。你先做第一个,跑通了再往下走。 看这张表的方法:左边是你对 agent 说的话,右边是你要提前写好、挂给它用的那个函数。
| 做什么 Demo | 你会对 agent 说什么 | 你要给它准备的工具 |
|---|---|---|
| 问答 | 「画面里谁没戴安全帽?」 | get_detections() 返回当前帧检测 |
| 动态调参 | 「高空误检多,把 conf 调高」 | set_conf(threshold) |
| 自愈 | 「推流卡了,重启一路」 | restart_stream(id) |
| 复盘 | 「今天哪路漏检最多?」 | get_metrics() 返回分域评测 |
三、怎么搭(复用 Phase 4 骨架)
不用重写,你把 Phase 4 那个骨架直接搬过来,只换掉工具表就行。 下面这段就是把「计算器」换成了你自己系统里的四个开关。
tools = {
"get_detections": lambda: 当前帧检测结果,
"set_conf": lambda t: 改管线 conf 阈值,
"restart_stream": lambda id: 重启指定路,
"get_metrics": lambda: 返回分域 AP/FPPI,
}
# 记忆 = 对话历史;RAG = 检索你的 ARCHITECTURE.md / 优化清单
# 循环 = Phase4 的 while;模型 = Hermes / 任意 LLM
一个值得琢磨的点:agent 去改
conf、去重启某一路,本质上是在拧你 Phase 0 里拆出来的那些旋钮和线程。
所以你对自己系统理解得越透,能交给 agent 的工具就越靠谱、越好用。
这就是两条线互相加分的地方。
四、收口后的能力画像
都做完之后,你面试时可以这样介绍自己。下面这段话,每一句背后都是你真跑过的东西。
「我搭过生产级实时视觉推理管线(ffmpeg 拉推流 + TensorRT 量化 + 多路并发),能压住延迟并保小目标精度;同时写过能编排这条管线的 agent,把视觉能力暴露成工具。两端都自己读码、自己调优,不靠黑箱。」
这段话 = 视觉部署 + Agent 双修。 它正好对上市场最缺的那五项能力:界定问题、读码定位、领域纵深、生产落地、取舍判断。
五、🔧 Phase 5 验收
下面三条做到,整条路线就算走完了。
- 跑通一个能调用视觉工具的 agent demo。哪怕只有 get_detections 加问答,也算数。
- 你能现场演示:让 agent 动态调参,或者回答「谁没戴安全帽」。
- 你能讲清楚,agent 的每一个工具,对应你管线里的哪一段代码。