在 Microsoft Foundry 的 Agent 中使用 Jev 做模型评估

本文参考了 Microsoft Community Hub 上 Robin Lester 的文章 Using Jev with Agents in Microsoft Foundry for Model Evaluation,下面是我整理的理解和步骤。

Jev 是什么

Jev 是 TypeSafe AI 推出的新模型,2026 年 9 月 15 日开放了抢先体验。TypeSafe 把它称为自家第一个“System One”模型,它不写长篇文字,只负责又快又结构化地做判断。

用法很直接:把一段状态或上下文交给它,再说明你想让它做什么判断,它会返回一个带类型的概率化结果。结果有三种形式:

……

阅读全文

[译]基于模型的机器学习 - 5.6 另一个冷启动问题

当我们绘制电影在特质空间中的位置时(之前的图 5.14),我们只展示了那些位置能被合理准确地知道的电影(也就是后验方差较低的那些)。由此可知,有许多电影的后验方差较大,甚至可能大得多。这意味着我们基本上不知道某些电影在特质空间中的位置。我们可能会预期这些是那些没有很多评分的电影。如果我们不知道某些电影在特质空间中的位置,那么我们可能会预期与这些电影相关的推荐准确性会很低。我们该如何诊断是否属于这种情况呢?

首先,了解每部电影通常有多少评分会很有用。图 5.25 展示了整个数据集中每部电影的评分数量,电影从左边评分最多到右边评分最少排序。

图 5.25

图 5.25:整个数据集中为每部电影给出的评分数量。电影从左边评分最多到右边评分最少排序。

……

阅读全文

[译]基于模型的机器学习 - 5.5 建模星级评分

星级评分

我们的模型把完整的星级评分范围变成了简单的喜欢或不喜欢,这意味着它丢弃了大量有用的信息。给一部电影打 3 星和打 5 星之间有天壤之别,然而我们却把这两种情况同等对待。为了利用不同的星级评分,我们需要改变模型,使其能够处理完整的评分范围,而不是二值的喜欢/不喜欢。这不仅让我们能够在星级评分上训练,还让我们能够预测星级评分——一举两得!

我们可以在已经设计好的二值喜欢/不喜欢模型的基础上做出这一改变。在这个模型中,我们有一个 affinity(好感度)变量,它是一个连续的数字,表示一个人对一部电影的喜欢程度。目前我们在零处对这个好感度取阈值,说大于零的值意味着这个人喜欢这部电影,小于零的值意味着他们不喜欢这部电影。为了建模不同的星级评分,我们可以假设更高的好感度意味着一个人会给出更高的星级评分。更确切地说,我们现在不再只在零处取阈值,而是为每一个星级评分引入一个阈值。如果一个人对一部电影的好感度高于某个特定星数的阈值,那么我们就预期他们会给这部电影至少那么多星。

……

阅读全文

Microsoft Foundry 智能体的 A2A 端点与 A2A 工具

A2A Endpoints and A2A Tool in Microsoft Foundry agents

最近我在研究 Microsoft Foundry 的多智能体能力时,注意到一个变化:智能体之间的协作终于不用再靠一堆自定义 API 拼凑了。A2A 工具和新的入站 A2A 端点现在支持 A2A 协议 1.0 版本,这个版本已经正式发布(GA)。之前预览阶段用的 a2a_preview 工具类型和 0.3 版协议依然保留,给已有的集成留了一条兼容路径。托管智能体(Hosted Agents)也可以通过暴露在 MCP 上的 Foundry 工具箱来使用 A2A 工具。

……

阅读全文

[译]基于模型的机器学习 - 5.4 我们的首次推荐

竖起或放下大拇指

有了我们训练好的两特质模型,我们现在准备好做一些推荐了!在训练期间,我们学到了每部电影和每个人在特质空间中(不确定的)位置。我们现在可以为验证集中每一条被留出的评分做预测。我们一次做一条评分——也就是说,一次针对一个人和一部电影。首先,我们把电影 trait 和人的 preference 的先验设为训练期间学到的后验。然后我们运行期望传播来推断 likesMovie 上的后验分布,以计算这个人会喜欢这部电影的概率。在验证集中所有评分上重复这一过程,就得到了每个人喜欢每部电影的概率,如图 5.15a 所示。图 5.15b 显示了对应的真实标签喜欢/不喜欢的值。

图 5.15a 推断的喜欢概率

(a) 推断的喜欢概率

图 5.15b 真实标签喜欢/不喜欢

(b) 真实标签喜欢/不喜欢

图 5.15:我们推荐模型的初步结果。(a) 计算得到的每个人喜欢每部电影的概率。白色方块对应概率 1.0,黑色对应概率 0.0,灰色的深浅表示介于两者之间的概率值。(b) 真实标签——白色表示这个人喜欢这部电影,黑色表示他不喜欢。

从图 5.15b 中最先引人注意的一点是,人们大多喜欢电影,而不是不喜欢它们。因此从某种意义上说,我们给推荐系统设定的任务,是试图找出一个人不喜欢的少数几部电影。看图 5.15a 中预测的概率,我们可以在这个任务上看到一些成功——因为某些较暗的方块确实与真实标签中的黑色方块正确对齐了。此外,某些行总体上比平均更暗或更亮,表明我们能够学到每个人总体上有多可能喜欢或不喜欢电影。然而,这些预测并不完美——有许多不喜欢的电影被漏掉了,也有一些不喜欢的预测是错误的。但在我们对模型做任何改进之前,我们需要先决定用哪些评估指标来度量和追踪这些改进。

……

阅读全文

[译]基于模型的机器学习 - 5.3 训练我们的推荐系统

在能够训练我们的模型之前,我们需要一些数据来训练它。好消息是,有一些高质量的公开数据集可以用来训练推荐模型。我们将使用明尼苏达大学 GroupLens Research 提供的、极为出色的 MovieLens 数据集之一 [Harper and Konstan, 2015]。我们将使用一个已经免费提供、供教育和开发用途的数据集——谢谢你,MovieLens!你可以自己使用这个链接下载该数据集。

认识我们的数据

与任何新数据集一样,我们的首要任务是认识数据。首先,这里是数据集中 10 条评分的样本:

表 5.3

表 5.3:来自 MovieLens 数据集的评分样本。

……

阅读全文

评估智能体 AI:Microsoft Foundry 如何超越“最终答案质量”

原文:Evaluating Agentic AI in Microsoft Foundry: Beyond Final-Answer Quality,作者 jothsnapraveena,发布于 2026-09-10

AI 系统正在从单轮对话助手演变成会调用工具的智能体,评估方式也必须跟着变。这是我最近研究 Microsoft Foundry 智能体评估功能时最直接的感受。

做传统 LLM 应用的团队,通常只关心最终回复是否相关、连贯、有依据。但智能体不一样,这只是问题的一部分。

……

阅读全文

[译]基于模型的机器学习 - 5.2 多重特质与多人

我们那个只有一个特质的模型,并不能很好地刻画电影。为了看清这一点,让我们再看一眼图 5.4:

图 5.4

只用动作/情感这一个特质,我们几乎无法区分《狮子王》和《莫扎特传》,因为它们在这条特质线上的位置非常接近。因此,对于这幅图中的这位女士,我们没办法在不同时推荐像《狮子王》这样的电影(她不喜欢)的情况下,去推荐像《莫扎特传》这样的电影(她喜欢)。

我们可以通过使用额外的特质来解决这个问题。如果我们加入第二个特质,表示影片有多逃避现实或多写实,那么每部电影现在除了在原来的特质线上有一个位置外,在这条第二特质线上也会有一个位置。这个第二特质值让我们能够区分这两部电影。为了看清这一点,我们可以把电影展示在一张二维图上,其中逃避现实/写实的特质位置位于纵轴上,如图 5.8 所示。

……

阅读全文

智能体的自动化,为什么还没有想象中那么高效

自动化操作界面这件事,其实做了很多年,比现在这一波智能体热潮早得多。做过爬虫的人都知道,早年靠的是人工写脚本,解析网页结构,模拟鼠标点击,往文本框里塞字符,效率全看脚本写得细不细。这两年多了视觉能力,智能体可以直接看着屏幕做判断,写脚本这一步确实省了不少。但要说这是自动化能力质的突破,我觉得有点急。

……

阅读全文

[译]基于模型的机器学习 - 5.1 学习用户和电影

本章的目标是向特定的人做出个性化的电影推荐。思考这个问题的一种方式,是想象一张表格,其中行是电影、列是人。表格的单元格显示这个人喜欢还是不喜欢这部电影——例如,如表 5.1 所示。这张表格是一个例子,展示了我们用来训练推荐系统时可能拥有的那类数据:我们询问了若干人,让他们说出自己是喜欢还是不喜欢某些特定的电影。

……

阅读全文

最近文章

分类

标签

友情链接

其它