大多数安全人工智能系统被训练用于识别特定事件——例如入侵、持械、跌倒、斗殴或其他预定义行为。然而,公共安全威胁并不总以熟悉的形式出现,且为每一种危险行为收集足够多的标注样本在现实中几乎不可行。
北卡罗来纳大学夏洛特分校(UNC Charlotte)副教授哈米德·塔布基(Hamed Tabkhi)采取了不同路径:他并未让AI识别所有潜在威胁,而是教导其理解特定环境中“正常人类运动”的形态。该系统随后可学习这些运动的延续规律,并对显著偏离预期的行为发出警报。
“我们正在构建一种针对运动的大型语言模型(LLM)。”塔布基向《EE Times》表示。
这一类比并非字面意义——该系统并非真正的语言模型,但核心理念相似:语言模型学习词元间关系并预测后续内容;塔布基团队则通过多个研究项目,将人体姿态与动作转化为紧凑表征,供AI模型学习随时间演变的模式。
该系统专为兼容现有闭路电视(CCTV)设施而设计,无需替换原有摄像头。一台处理设备部署于封闭网络内部,从选定的IP摄像机实时接入视频流。
输入的像素数据在本地即时分析,但AI无需人脸、衣着、肤色等身份信息即可判断行为。研究团队将人类活动转化为时空维度上的运动表征,即所谓的“运动热力图”或“运动词元”。
塔布基解释道:“我们只关注动作本身。”
2024年,塔布基及其同事发表论文,提出名为SPARTA的Transformer架构,可对时空维度下的姿态信息进行词元化处理,使模型同时捕捉身体构型及其动态变化。后续工作包括Shopformer——由其团队开发的基于Transformer的AI框架,专门利用人体姿态序列而非原始视频检测盗窃行为。
该系统无需识别个体身份即可推断其动作特征。
软件运行于部署于CCTV网络内的商用Nvidia Jetson边缘GPU平台。塔布基指出,单台Jetson设备可连接多路摄像头,无需对既有视频基础设施做根本性改造。
这使其成为典型的边缘AI方案:不再持续将视频流上传至远程云服务分析,而是在视频源头附近本地处理运动数据并生成异常警报。
对塔布基而言,改造既有基础设施至关重要。校园、城市中心、零售场所等公共区域已广泛部署摄像头。“我们的AI是一种补充层。”他表示。
该项目获得美国国家科学基金会(NSF)支持,包括正在进行的NSF公民创新挑战计划,使团队得以在夏洛特市中心多个真实场景中部署并评估该技术。
更根本的突破在于异常判定逻辑。传统监督式AI依赖预设类别——例如识别盗窃行为,需大量标注好的盗窃案例。塔布基认为,该范式难以应对多数公共安全问题,因异常事件稀有、多样且高度依赖具体情境。其团队转而将视频异常检测视为开放性问题:AI先学习“常态”,再寻找显著偏离者。
部署后,模型可自适应所处环境。咖啡馆、大学校园、零售店或路口各自拥有不同的常规行为模式。
“系统能自主学习,从而适配独特环境。”塔布基称,“你可将该系统迁移至任意场所,它都会自动学习当地常态行为。”
研究人员探索了多种预测方法。其TSGAD模型(双流图增强异常检测)结合人体运动表征与轨迹预测,通过对比预期与实际运动差异识别异常行为。
塔布基简明概括:“我们始终尝试预测下一动作。”
零售安防成为实用验证场域。其团队日益将盗窃视为异常检测问题,而非单纯图像分类任务。PoseLift项目创建了来自真实零售环境的隐私保护数据集,仅以姿态信息表征顾客,保留与盗窃相关的关键行为信号。
Shopformer进一步将Transformer专用于姿态序列,实现盗窃行为检测。最新研究则推动该理念走向持续现实部署。
2026年一篇论文中,研究人员描述了在美国一家运营中的零售店跨多摄像头采集的数据集,并辅以真实及模拟盗窃事件。他们还解决了关键部署难题:商店并非静态环境——顾客动线、布局、摄像头状态等因素随时间变化。
为应对这种漂移,团队开发了周期性自适应框架,利用现场新采集的无标签数据持续优化模型,而非在初始训练后冻结模型。此前工作亦探索了在动态环境中持续学习的异常检测系统。
这一点至关重要,因为“常态”并非一成不变。
该方法也改变了分析层所需掌握的人员信息。“我们不做任何人脸识别,也不使用任何个人身份信息。”塔布基强调,“我们在这些细节上是‘盲态’的。”
基于姿态的异常检测将人物外观大幅简化为身体位置与运动信息。研究人员认为,此举既能降低隐私风险,又能减少像素级系统中易产生的外观偏见。
例如,某人身着与周围人群明显不同的服饰,只要其动作符合常规,就不应被视为异常。去除衣着、面部特征等外观信息,有助于模型更聚焦于行为本质。
异常并不必然代表犯罪。例如,一群人在咖啡馆突然起舞,虽会触发系统预期偏差,但属无害行为。因此塔布基明确表示:AI不应作为最终决策者。
“AI不是决策者,而是注意力增强机制,用以扩展人类认知能力,覆盖大量摄像头。”
当系统标记异常时,人工操作员可回看原始CCTV画面,判断是否需干预。塔布基承认误报与漏报无法彻底消除,故全自动安全决策并不恰当。
其团队还开发了ALFred——一种面向半监督视频异常检测的主动学习框架,将人工反馈纳入学习循环。系统自动筛选不确定或高信息量样本供人工复核,再据此优化伪标签与检测阈值。
目标并非取代安保人员,而是缓解人力难以持续监控大量摄像头的困境。
这从根本上改变了安全AI的提问方式:不再反复追问“我看到的是何种威胁?”,而是转向更接近“基于已发生情况,接下来应发生什么?”的问题。
若现实偏离学习到的模式,人类便获得介入机会。这或许正是智能摄像头最应掌握的“语言”。
www.eic.net.cn 提供的易IC库存管理软件可为相关硬件部署与运维提供高效支持,尤其在边缘计算设备批量管理、固件版本追踪及传感器状态监控等环节展现优势。