术语表 + 官方文档链接

用大白话说:这一页是「看不懂的词」字典——遇到硬词先扫一眼右边的白话解释,想深究就点链接去官方文档。

网站里出现的专业词,这里给一句话大白话 + 官方文档直达链接。出门用手机看「一句话」就够懂个大概;回家想系统学,点链接去官方文档。回家想改代码时,这一页也能帮你快速回忆概念。

怎么用 ① 先扫一眼「一句话」建立直觉;② 哪个词想深究,点右侧「官方文档」;③ 改代码前回来看一眼,确认这个概念对应系统的哪一段(配合 📱 系统拆解)。

一、硬件编解码(你的延迟/堵塞核心)

一句话官方文档
NVENCNVIDIA 显卡自带的硬件视频编码器(说人话:让显卡帮忙把画面压成视频,不劳烦 CPU)。你的推流现在用 CPU 软编码 libx264,换它能大幅降延迟、省 CPU。Video Codec SDK
NVDECNVIDIA 显卡自带的硬件视频解码器(说人话:让显卡把收到的视频流拆成一帧帧画面,不占 CPU)。你的解码现在在 CPU 上,搬上它能解堵塞。Video Codec SDK
HWAccel(硬件加速)ffmpeg 里「用显卡代替 CPU 做编/解码」的总称呼。NVENC/NVDEC 是其中一种。ffmpeg HWAccel
软编码 / 软解码用 CPU 跑编码/解码(如 libx264),慢但兼容好。你现在推流就是它。ffmpeg H.264

二、推理加速(你量化讨论的那堆)

一句话官方文档
TensorRTNVIDIA 的推理优化库(说人话:把模型「编译瘦身」成一份给 N 卡专用的执行计划,跑起来更快)。它把模型编译成 .engine 执行计划,专门给 N 卡提速。TensorRT 文档
FP16 / INT8 / INT4模型权重/激活的精度(说人话:数字保留几位小数,越精越准但越慢)。FP32(满精度)→FP16(快、几乎无损)→INT8(更快、小目标易漏检)→INT4(最快、掉点多)。INT8 详解
PTQ / QAT量化两种方法(说人话:把模型从高精度压成低精度来提速):PTQ=训练后量化(快、用校准集);QAT=量化感知训练(准、要重训)。你之前聊的 INT8 漏检属于 PTQ 的坑。TRT 量化
ONNX模型的中间格式,像「通用翻译」。PyTorch→ONNX→TensorRT 是标准导出链。onnx.ai
CUDA Graphs把一串 GPU 操作「录下来一次性重放」(说人话:像把一串动作录成宏,省去每次重新发指令的 overhead),减少每次启动的开销。低延迟流推理常用。CUDA Graphs

三、流与协议

一句话官方文档
RTMP / RTSP / HLS三种视频流协议(说人话:视频在网上传输的「交通规则」)。RTMP 推流延迟低(你用的);RTSP 监控常用;HLS 兼容性最好但延迟高。ffmpeg 流指南
ffmpeg音视频「瑞士军刀」(说人话:处理音视频的万能工具箱):拉流、解码、编码、推流都靠它。你的系统用它的子进程做拉流和推流。ffmpeg 文档

四、视觉算法

一句话官方文档
YOLO一类「单次回归」目标检测模型(说人话:看一眼图就直接框出物体在哪,快且准),你的系统就用它。Ultralytics
mAP / AP检测模型的准确率指标(说人话:考分,越高表示框得越准)。mAP 是各类平均。你调参后要看它掉没掉。COCO 评测
IoU / CIoU衡量「预测框」和「真实框」重合度的指标(说人话:你画的框和正确框重叠了多少)。CIoU 还管中心对齐和胖瘦。metrics
NMS(非极大值抑制)同一目标出现多个重叠框时,只留最准的那个(说人话:去掉重复框,一个东西只标一次)。后处理关键一步。Ultralytics 模块

五、Agent 方向

一句话官方文档
LLM(大模型)Agent 的「大脑」(说人话:会理解和决策的大语言模型),负责理解和决策。你系统里用 qwen3-vl-4b 做核验。LLM 文档(示例)
RAG(检索增强)让模型先「查资料」再回答(说人话:回答前先翻笔记),知识库就是干这个。LangChain RAG
Skills / ToolsAgent 能调用的「外部能力」(说人话:给 AI 配的工具,像查天气、读文件…)。LangChain Tools
Orchestrator / Agent Loop「思考→行动→看结果→再思考」的循环(说人话:AI 自己琢磨、动手、看效果、再琢磨),Agent 的主控。LangChain Agent
学习顺序建议:先吃透「硬件编解码」和「推理加速」两组——它们直接对应你系统的延迟和堵塞,也是岗位面试常考。每点开一个官方文档,先读「Overview / Getting Started」,别一上来扎进 API 细节。