

使用AI驱动的系统的原型一直以来都更加复杂。但是,在使用原型一段时间后,您可能会发现它可以更加功能强大。通过基本的编程理解和几个小时的时间,可以创建一个用于记录笔记的聊天机器人、一个用于从文本创建图像的编辑器以及一个用于总结客户评论的工具。
在实际世界中,机器学习(ML)系统可能存在社会偏见和安全问题。从行人检测模型中的种族偏见到特定医学图像的系统误分类,从业者和研究人员不断发现当前最先进模型的重大局限和失败。行为评估或测试常用于发现和验证模型的局限。了解子组或输入数据切片的模型输出模式超出了检查准确性或F1分数等聚合指标的范围。ML工程师、设计师和领域专家等利益相关者必须共同努力,确定模型的预期和潜在故障。
尽管进行行为评估非常重要,但实际操作仍然很困难。此外,许多流行的行为评估工具,如公平性工具包,不支持实际从业者通常处理的模型、数据或行为。从用户和利益相关者手动测试精选案例来评估模型并选择最佳部署版本是常见做法。在从业者熟悉将使用模型的产品或服务之前,经常会先创建模型。
了解机器学习模型在完成特定任务方面的表现如何是模型评估的难点。使用聚合指标只能大致估计模型的性能,就像智商测试只是对人类智能的粗略和不完美的衡量一样。例如,它们可能无法在自然语言处理系统中嵌入准确的语法,或者掩盖社会偏见等系统性缺陷。标准的测试方法是在数据子集上计算整体性能指标。
确定模型应具备哪些特征是行为评估领域的重要问题。在复杂的领域中,由于可能存在无休止的要求,测试需求列表将是不可能的。因此,ML工程师与领域专家和设计师合作,在迭代和部署之前描述模型的预期功能。用户通过与产品和服务的交互提供对模型的限制和预期行为的反馈,这些反馈随后被纳入未来的模型迭代中。
存在许多用于识别、验证和监控ML评估系统中模型行为的工具。这些工具利用数据转换和可视化揭示模型的公平性问题和边界情况等模式。Zeno与其他系统合作并结合其他方法。基于子组或切片的分析,即在数据集的子集上计算指标,是最接近Zeno的行为评估方法。Zeno现在允许针对任何领域或活动进行基于滑动和变形的测试。
Zeno由Python应用程序编程接口(API)和图形用户界面(GUI)组成。模型输出、指标、元数据和修改后的实例只是行为评估的基本组成部分之一,可以实现为Python API函数。API的输出是构建进行行为评估和测试的主界面的框架。Zeno有两个主要的前端视图:探索UI用于数据发现和切片创建,分析UI用于测试创建、报告创建和性能监控。
Zeno通过Python脚本向公众提供。编写的前端界面使用Svelte,使用Vega-Lite进行可视化和Arquero进行数据处理;该库包含在Python软件包中。用户在指定必要的设置(包括测试文件、数据路径和列名)后,可以从命令行启动Zeno的处理和界面。Zeno将UI作为URL端点托管的能力意味着它可以在本地或服务器上与其他计算一起部署,并且用户仍然可以从自己的设备访问它。该框架已经在包含数百万实例的数据集上进行了尝试和验证。因此,它应该能够很好地适应大规模的部署场景。
机器学习环境中存在许多框架和库,每个框架和库都专注于特定的数据或模型。Zeno在很大程度上依赖于基于Python的模型推理和数据处理API,可以进行定制。研究人员开发了Zeno的后端API作为一组Python装饰器方法,可以支持大多数现代ML模型,尽管大多数ML库都基于Python,因此存在相同的碎片化问题。
研究团队进行的案例研究显示,Zeno的API和用户界面的协同作用有助于从数据集和任务中发现重大的模型缺陷。从更广泛的意义上讲,研究结果表明,行为评估框架对于各种数据和模型类型都是有用的。
根据用户的需求和任务的难度,Zeno的各种功能使行为评估变得更简单、更快捷、更准确。在案例2中,参与者使用API的可扩展性创建了模型分析元数据。案例研究参与者报告称,将Zeno整合到他们现有的工作流程中并与Zeno API进行交互的难度很小或几乎没有。
约束和预防措施
- 了解哪些行为对最终用户来说是必要的并由模型编码是行为评估的一个主要难点。研究人员正在积极开发ZenoHub,这是一个协作仓库,用户可以在其中分享他们的Zeno函数,并更容易地找到相关的分析组件,以鼓励模型函数的重用,以支持发现。
- Zeno的主要功能是定义和测试数据片段的度量标准,但该工具仅提供有限的网格和表格视图来显示数据和片段。通过支持各种强大的可视化方法,可以提高Zeno的实用性。用户可以通过编码语义相似性的实例视图(如DendroMap、Facets或AnchorViz)来发现数据中的模式和新行为。ML Cube、Neo和ConfusionFlow是Zeno可以修改以更好显示模型行为的一些ML性能可视化工具。
- 虽然Zeno的并行计算和缓存使其能够扩展到大型数据集,但机器学习数据集的大小正在迅速增加。因此,更多的改进将大大加快处理速度。使用像Ray这样的库在分布式计算集群中进行处理可能是未来的更新。
- 多个直方图在非常大的表格上进行交叉过滤是另一个障碍。Zeno可以采用像Falcon这样的优化方法,以便在大规模数据集上实现实时交叉过滤。
总结:
即使机器学习模型在训练数据上达到了很高的准确率,它在实际世界中仍然可能遭受系统性的失败,例如负面偏见和安全隐患。从某种意义上讲,从行为的角度对模型进行评估是从某些输入到模型输出的模型缺陷的识别和纠正。行为评估的重要性不言而喻,但也很困难,需要揭示现实世界中的模式,并验证系统性的失败。对机器学习的行为评估是识别和纠正问题模型行为的关键,包括偏见和安全问题。在这项研究中,作者深入探讨了机器学习评估的困难,并开发了一种在各种情境中对模型进行评分的通用方法。通过四个实际案例研究中,实践者对现实世界的模型进行了评估,研究人员展示了Zeno如何在多个领域中应用。
许多人对人工智能的发展抱有很高的期望。然而,他们的行为复杂性与他们的能力发展的速度相同。拥有强大的资源来促进基于行为的开发,并确保构建与人类价值观相协调的智能系统是至关重要的。Zeno是一个灵活的平台,允许用户在各种与人工智能相关的工作中进行这种深入的考察。