Microsoft Foundry 中的文章
GPT Realtime 上生产环境:到底该选哪种上下文策略?
如果你已经把 gpt-realtime 跑上了生产环境,大概率撞到过同一个问题:多轮对话之间,上下文到底该怎么管?
听上去像个实现细节,其实不是。这个决定直接关系到:你每通电话的成本是三毛还是九毛,你呼叫中心的延迟能不能压在两秒以内,以及你的客户会不会在同一通电话里被迫把账号报上五遍。
企业客户把语音和对话式 AI 从 demo 推向规模化时,追问的其实是同一件事:怎么优化 prompt 缓存策略,让调用量从每天一百通涨到十万通时,token 账单和延迟预算不会跟着爆炸。缓存是 realtime API 上撬动成本最狠的那根杠杆:缓存过的音频输入比未缓存便宜 99%,而解锁它靠的是一个稳定的前缀(prefix)。但到底哪种缓存策略真的赢,取决于你的应用是一次性查询、一段简短对话,还是呼叫中心那种动辄三十轮的升级工单。
……Microsoft Foundry 智能体的 AI 可观测性入门套件
本文编译自 Microsoft Tech Community 上 varghesejoji 的博客文章 AI Observability Starter Kit for Microsoft Foundry agents,我按自己上手时的理解重新整理,并补充了一些实际跑下来的体会。
先把结论放前面:一条 PowerShell 命令,就能拉起一个包含四个智能体的 Microsoft Foundry 环境,带遥测、8 个内置评估器、1 个自定义合规评估器、一次自动化红队扫描,还有两条 scheduled-query 告警。整套东西端到端验证过,再敲一条命令就能全部拆掉。Fork 下来直接跑。我觉得它最对胃口的人群是那些在 Azure 上跑 AI 智能体、又不想自己手写一堆管道代码的应用开发者、ML 工程师和 SRE。
……迁移到 GPT-5.x 而不搞坏 GPT-4:一套实用的向后兼容迁移手册
我第一次把生产环境里的 gpt-4o 换成 gpt-5.1,服务发出的第一个请求就吃了个 HTTP 400。不是上线两周后才暴露,而是第一次调用就报错。更糟的是,报错指向的那个参数,我在自己代码里根本没写过——它是被一个我用了两年的 LangChain 辅助函数悄悄绑上去的。
所以这篇我想认真拆一下:从 GPT-4 家族迁移到 GPT-5 家族,在 Azure OpenAI(Microsoft Foundry)上到底有哪些破坏性变更,那些没人提前警告你的集成陷阱,以及要让同一处调用代码同时兼容两个模型家族、不做分支,我到底需要哪几个文件。
……在 Microsoft Foundry 中用 Model Router 构建成本感知的 LLM 工作负载
前段时间在整理自家 GenAI 平台的模型调度方案,我又把 Microsoft Foundry 的 Model Router 翻出来仔细看了一遍。以前"这个请求该走哪个模型"是塞在应用代码里的一堆 if-else,现在它能被挪到平台层统一管起来。这篇就把我看下来的心得和踩过的点记一记,原文在这儿:Architecting Cost-Aware LLM Workloads with Model Router in Microsoft Foundry。
我最在意的其实就一件事:把多模型路由收进一个能被治理的部署里。故障转移它自己扛,数据驻留边界它帮你守住,18 个底层 LLM 之间该怎么在成本和质量之间权衡,也是按每一条 prompt 现算的。
……Claude 托管智能体 + Azure:没有人谈论的多云 AI 战略
在过去一年里,我一直在研究生产级 AI 智能体的构建。多智能体系统、RAG 流水线、一个全天候运行在 Mac mini 上的自主编程智能体……这些项目里最难搞的从来不是 AI 本身,而是基础设施。
沙箱隔离、状态管理、工具执行、容器编排、凭据轮换、错误恢复——在智能体真正能做什么有用的事之前,往往需要好几个月的水管工程。
……Azure AI Search 中的向量漂移:RAG 部署后准确率下降的三个隐藏原因
用 Azure AI Search 加 Azure OpenAI 搭 RAG 系统时,我碰到过一个很典型的现象:上线初期检索质量挺好,跑了一阵子却慢慢变差。代码没动,基础设施没改,服务也没出故障,可检索的相关性就是在往下掉。折腾了一番我才搞清楚,背后常见的元凶叫向量漂移(vector drift)。这篇就说说向量漂移到底是什么、它为什么会在生产环境的 RAG 系统里冒出来,以及怎么用 Azure 原生的模式设计一套抗漂移的架构。
……Azure AI Foundry — 多代理编排与工作流
Azure AI Foundry(前身为 Azure AI Studio)是微软提供的端到端平台,用于构建、测试、部署和监控 AI 代理及应用程序。它将模型、工具、框架和治理能力整合到一个统一的系统中。
现代企业自动化往往需要多个 AI 系统协同完成任务。与其让单一的大型语言模型承担所有工作,Azure AI Foundry 引入了多代理编排机制——让专业化的 AI 代理在工作流中相互协作。
……Agent 可观测性:Application Insights·OpenTelemetry·Trace 分析
这篇文章记录的是如何观察和了解 Agent 在现实中的实际运行状态。
Agent 与普通 API 有根本的不同。它不是简单的请求/响应就结束,而是一套多阶段流程:LLM 推理 → 工具调用 → 结果处理 → 再推理。出错时,很难立即看出是哪个阶段因为什么原因失败了。速度慢时,也搞不清楚时间消耗在哪里。在成本方面,更难分析是哪个查询消耗了大量 Token。
……使用 Claude Agent SDK 和 Microsoft Agent Framework 构建 AI 代理
Microsoft Agent Framework 现已集成 Claude Agent SDK,让我们能够构建由 Claude 完整代理能力驱动的 AI 代理。这个集成将 Agent Framework 的一致代理抽象与 Claude 的强大功能结合在一起,包括文件编辑、代码执行、函数调用、流式响应、多轮对话以及模型上下文协议(MCP)服务器集成——目前在 Python 中可用。
为什么将 Agent Framework 与 Claude Agent SDK 结合使用?
我们可以单独使用 Claude Agent SDK 来构建代理。那么为什么要通过 Agent Framework 来使用它呢?以下是主要原因:
……