.fav_bar { 浮动:左; 边框:1像素实线# a7b1b5; 上边距:10像素; 下边距:20像素; } .fav_bar span.fav_bar-label { 文本对齐:中心; 填充:8像素0像素0像素0像素; 浮动:左; 左边距:-1像素; 右边框:1像素点状# a7b1b5; 左边框:1像素实线# a7b1b5; 显示:块; 宽度:69像素; 高度:24像素; 颜色:# 6e7476; 粗体字体:12像素; 文本转换:大写; 字体系列:Arial,Helvetica,sans-serif; } .fav_bar a,#plus-one { 浮动:左; 右边框:1像素点状# a7b1b5; 显示:块; 宽度:36像素; 高度:32像素; 文本缩进:-9999像素; } .fav_bar a.fav_print { 背景:url(’/images/icons/print.gif’)不重复0像素0像素#FFF; } .fav_bar a.fav_print:hover { 背景:url(’/images/icons/print.gif’)不重复0像素0像素#e6e9ea; } .fav_bar a.mobile-apps { 背景:url(’/images/icons/generic.gif’)不重复13像素7像素#FFF; 背景大小:10像素; } .fav_bar a.mobile-apps:hover { 背景:url(’/images/icons/generic.gif’)不重复13像素7像素#e6e9ea; 背景大小:10像素} .fav_bar a.fav_de { 背景:url(/images/icons/de.gif)不重复0 0 #fff } .fav_bar a.fav_de:hover { 背景:url(/images/icons/de.gif)不重复0 0 #e6e9ea } .fav_bar a.fav_acm_digital { 背景:url(’/images/icons/acm_digital_library.gif’)不重复0像素0像素#FFF; } .fav_bar a.fav_acm_digital:hover { 背景:url(’/images/icons/acm_digital_library.gif’)不重复0像素0像素#e6e9ea; } .fav_bar a.fav_pdf { 背景:url(’/images/icons/pdf.gif’)不重复0像素0像素#FFF; } .fav_bar a.fav_pdf:hover { 背景:url(’/images/icons/pdf.gif’)不重复0像素0像素#e6e9ea; } .fav_bar a.fav_more .at-icon-wrapper { 高度:33像素!重要; 宽度:35像素!重要; 填充:0!重要; 右边框:无!重要; } .a2a_kit { 行高:24像素!重要; 宽度:不确定!重要; 高度:不确定!重要; 填充:0!重要; 右边框:无!重要; 左边框:无!重要; } .fav_bar .a2a_kit a .a2a_svg { 左边距:7像素; 顶边距:4像素; 填充:取消设置!重要; }

计算机视觉已经改变了许多任务-从检查制造线上的零件到验证乘客上飞机时的身份。它可以在各种情况和场景下提供高质量的结果。然而,随着条件变得更加复杂和苛刻,技术的准确性和实用性都会下降。
问题根源于计算机视觉和人工智能(AI)的性质。数据科学家使用大量数据对今天的系统进行卷积网络训练-在许多情况下,是数万张图像。然而,当计算机视觉系统被迫使用不完整或未知的变量来识别对象时,它很可能会遇到挑战并且犯下严重错误。
“今天的计算机视觉系统在涉及训练的固定环境中识别事物方面非常出色,”加州大学洛杉矶分校(UCLA)的电气工程和计算机科学助理教授Achuta Kadambi说。然而,光照、可见性或压力的变化可能会导致这些系统错误地判断情况,他说。他解释说:”我们无法建立一个详尽的训练集来解决所有现实世界的变量。”
结果导致,研究人员正在探索使用从基于物理传感器和系统收集的元数据来补充传统计算机视觉数据的方法。2023年6月,来自UCLA和美国陆军研究实验室的一个团队在《自然机器智能》上发表的学术论文中介绍了一种新颖的方法。“目标是通过调用从物理定律中获得的思想来帮助这些系统更好地‘看见’,”Kadambi说。
与Kadambi经常合作的UCLA大卫·格芬医学院的副教授和麻醉师Laleh Jalilian补充道:“将物理属性纳入计算机视觉中可能会提高许多设备的准确性并引入全新的技术。”
改进视野
今天的计算机视觉技术的强大很让人惊叹,但是工程师和产品设计师不得不面对一个不便的事实:深度学习模型在没有任何内在理解所“看见”的对象和环境的情况下运行。结果完全基于模型准确预测接下来会发生什么。
即使是最先进的计算机视觉方法也只能提供有限的预测能力。例如,Kadambi指出,当深度学习模型尝试绘制运动中的棒球或飞机的轨迹时,情况可能变得非常糟糕。由于深度学习系统没有针对显性建模环境因素(例如气压、阻力和天气等),“轨迹可能从稍微偏离到极其不准确不等”,Kadambi说。
对于面部扫描或系统在装配线上遇到多个相同物品的情况,这些异常并不特别重要。然而,对于运动中的物体和那些需要基于平面几何的高级三维预测能力的物体,例如自动驾驶车辆和一些医疗仪器,问题可能会出现。“实际物理环境并没有显性地纳入计算机视觉框架中,”Kadambi指出。
这些边缘情况并不完全罕见,它们可能导致系统以不可预测的、有时是致命的方式做出反应。例如,2018年,一辆无人驾驶的Uber车辆因未能意识到一个女人正在穿过马路上的自行车而导致她死亡。计算机视觉系统已经被训练用于识别行人和自行车,但不能同时识别两者。
Kadambi和他的研究团队开发的混合方法直接针对这一挑战。通过将基于物理的属性(源自物联网设备、量子传感器和人们对物理属性的一般知识的元数据)纳入其中,可以达到更接近人类智能水平的智能水平。突然之间,模型可以应用已知的重力、阻力、重量、运动和气压等属性来生成更准确的预测。
这个框架主要关注三个主要领域:为对象添加附加信息,定义它们的行为方式;通过编码将物理注入网络架构,以便摄像头和人工智能系统可以读取;将物理数据插入训练集以构建更强大的人工智能模型。结果是,自动驾驶车辆、机器人或无人机在恶劣天气和其他困难条件下可能会更好地导航。
关注现实
然而,在物理元数据的未来,除了机器人和自动化系统之外,可能会带来更多的回报。例如,UCLA医学中心的Jalilian,她具有工程背景,正在探索通过数据标记来改进医疗设备的精度和准确性。这包括血氧计,有时会根据皮肤颜色产生误差。
Jalilian还正在研究使用由摄像头生成的图像和多模态传感器远程测量患者生命体征和获取其他数据。她说:“这项技术可以支持更先进的远程医疗。在视频流上运行环境AI算法的远程医疗设备可以提供对一个人状况的深入了解。”例如,系统可能会检测到血氧含量低的患者并向医生发出警报。“这将使医学从被动变为主动。”
其他研究人员也在研究如何补充计算机视觉数据。例如,来自麻省理工学院(MIT)和IBM的一组研究人员开发了一个依赖于以人脑为模型的物体识别方法的框架。这种额外的神经数据导致了更“类人”的处理,麻省理工学院教授James DiCarlo说。事实上,将生物数据添加到视觉流中导致了更高水平的物体分类准确性,尽管该系统也倾向于失败,就像人类一样。
虽然利用标签和其他形式的来自物理世界的元数据增强机器数据的想法只是开始形成,但Kadambi和其他人对这个技术将导致更强大和准确的计算机视觉以及避免视觉系统中可能出现的误报的能力持乐观态度。能够更好地看见的机器可能会从根本上改变机器人、自动化技术和其他感应系统的运作方式以及它们的使用场所。
「图像与来自语言系统的数据本质上是不同的,因为图像是基于光学物理定律生成的,」Kadambi得出结论。将基于物理的元数据插入计算机视觉系统「可以生成更好的模型并极大地增强其能力。」
Samuel Greengard是一位位于美国俄勒冈州West Linn的作者和记者。