GPT Realtime 上生产环境:到底该选哪种上下文策略?

如果你已经把 gpt-realtime 跑上了生产环境,大概率撞到过同一个问题:多轮对话之间,上下文到底该怎么管?

听上去像个实现细节,其实不是。这个决定直接关系到:你每通电话的成本是三毛还是九毛,你呼叫中心的延迟能不能压在两秒以内,以及你的客户会不会在同一通电话里被迫把账号报上五遍。

企业客户把语音和对话式 AI 从 demo 推向规模化时,追问的其实是同一件事:怎么优化 prompt 缓存策略,让调用量从每天一百通涨到十万通时,token 账单和延迟预算不会跟着爆炸。缓存是 realtime API 上撬动成本最狠的那根杠杆:缓存过的音频输入比未缓存便宜 99%,而解锁它靠的是一个稳定的前缀(prefix)。但到底哪种缓存策略真的赢,取决于你的应用是一次性查询、一段简短对话,还是呼叫中心那种动辄三十轮的升级工单。

……

阅读全文

Microsoft Foundry 智能体的 AI 可观测性入门套件

本文编译自 Microsoft Tech Community 上 varghesejoji 的博客文章 AI Observability Starter Kit for Microsoft Foundry agents,我按自己上手时的理解重新整理,并补充了一些实际跑下来的体会。

先把结论放前面:一条 PowerShell 命令,就能拉起一个包含四个智能体的 Microsoft Foundry 环境,带遥测、8 个内置评估器、1 个自定义合规评估器、一次自动化红队扫描,还有两条 scheduled-query 告警。整套东西端到端验证过,再敲一条命令就能全部拆掉。Fork 下来直接跑。我觉得它最对胃口的人群是那些在 Azure 上跑 AI 智能体、又不想自己手写一堆管道代码的应用开发者、ML 工程师和 SRE。

……

阅读全文

迁移到 GPT-5.x 而不搞坏 GPT-4:一套实用的向后兼容迁移手册

我第一次把生产环境里的 gpt-4o 换成 gpt-5.1,服务发出的第一个请求就吃了个 HTTP 400。不是上线两周后才暴露,而是第一次调用就报错。更糟的是,报错指向的那个参数,我在自己代码里根本没写过——它是被一个我用了两年的 LangChain 辅助函数悄悄绑上去的。

所以这篇我想认真拆一下:从 GPT-4 家族迁移到 GPT-5 家族,在 Azure OpenAI(Microsoft Foundry)上到底有哪些破坏性变更,那些没人提前警告你的集成陷阱,以及要让同一处调用代码同时兼容两个模型家族、不做分支,我到底需要哪几个文件。

……

阅读全文

在 Microsoft Foundry 中用 Model Router 构建成本感知的 LLM 工作负载

前段时间在整理自家 GenAI 平台的模型调度方案,我又把 Microsoft Foundry 的 Model Router 翻出来仔细看了一遍。以前"这个请求该走哪个模型"是塞在应用代码里的一堆 if-else,现在它能被挪到平台层统一管起来。这篇就把我看下来的心得和踩过的点记一记,原文在这儿:Architecting Cost-Aware LLM Workloads with Model Router in Microsoft Foundry

我最在意的其实就一件事:把多模型路由收进一个能被治理的部署里。故障转移它自己扛,数据驻留边界它帮你守住,18 个底层 LLM 之间该怎么在成本和质量之间权衡,也是按每一条 prompt 现算的。

……

阅读全文

Claude 托管智能体 + Azure:没有人谈论的多云 AI 战略

封面图片

在过去一年里,我一直在研究生产级 AI 智能体的构建。多智能体系统、RAG 流水线、一个全天候运行在 Mac mini 上的自主编程智能体……这些项目里最难搞的从来不是 AI 本身,而是基础设施。

沙箱隔离、状态管理、工具执行、容器编排、凭据轮换、错误恢复——在智能体真正能做什么有用的事之前,往往需要好几个月的水管工程。

……

阅读全文

Azure AI Search 中的向量漂移:RAG 部署后准确率下降的三个隐藏原因

用 Azure AI Search 加 Azure OpenAI 搭 RAG 系统时,我碰到过一个很典型的现象:上线初期检索质量挺好,跑了一阵子却慢慢变差。代码没动,基础设施没改,服务也没出故障,可检索的相关性就是在往下掉。折腾了一番我才搞清楚,背后常见的元凶叫向量漂移(vector drift)。这篇就说说向量漂移到底是什么、它为什么会在生产环境的 RAG 系统里冒出来,以及怎么用 Azure 原生的模式设计一套抗漂移的架构。

……

阅读全文

Azure AI Foundry — 多代理编排与工作流

Azure AI Foundry(前身为 Azure AI Studio)是微软提供的端到端平台,用于构建、测试、部署和监控 AI 代理及应用程序。它将模型、工具、框架和治理能力整合到一个统一的系统中。

多代理编排概览

现代企业自动化往往需要多个 AI 系统协同完成任务。与其让单一的大型语言模型承担所有工作,Azure AI Foundry 引入了多代理编排机制——让专业化的 AI 代理在工作流中相互协作。

……

阅读全文

Agent 可观测性:Application Insights·OpenTelemetry·Trace 分析

这篇文章记录的是如何观察和了解 Agent 在现实中的实际运行状态。

Agent 与普通 API 有根本的不同。它不是简单的请求/响应就结束,而是一套多阶段流程:LLM 推理 → 工具调用 → 结果处理 → 再推理。出错时,很难立即看出是哪个阶段因为什么原因失败了。速度慢时,也搞不清楚时间消耗在哪里。在成本方面,更难分析是哪个查询消耗了大量 Token。

……

阅读全文

使用 Claude Agent SDK 和 Microsoft Agent Framework 构建 AI 代理

Microsoft Agent Framework 现已集成 Claude Agent SDK,让我们能够构建由 Claude 完整代理能力驱动的 AI 代理。这个集成将 Agent Framework 的一致代理抽象与 Claude 的强大功能结合在一起,包括文件编辑、代码执行、函数调用、流式响应、多轮对话以及模型上下文协议(MCP)服务器集成——目前在 Python 中可用。

为什么将 Agent Framework 与 Claude Agent SDK 结合使用?

我们可以单独使用 Claude Agent SDK 来构建代理。那么为什么要通过 Agent Framework 来使用它呢?以下是主要原因:

……

阅读全文

使用 Microsoft Olive 和 Foundry Local 部署自定义模型

在过去的几周里,我一直在探索小语言模型(SLM)的部署之旅。从最初了解 Phi-4 和小语言模型的强大之处,到实践使用 Foundry Local 在本地运行模型,再到学习函数调用,最近还构建了一个完整的多智能体测验应用,其中包含一个协调专家智能体的编排器。

这个测验应用在本地运行得很好,但它依赖于 Foundry Local 目录中的模型——这些模型经过预优化且随时可用。但如果想部署一个不在目录中的模型该怎么办?也许你已经在特定领域的测验数据上微调了一个模型,或者 Hugging Face 上刚发布了一个你想使用的新模型。今天我将展示如何从 Hugging Face 获取一个模型,使用 Microsoft Olive 优化它,在 Foundry Local 中注册它,并在测验应用中运行它。同样的工作流程适用于你可能为特定用例微调的任何模型。

……

阅读全文

最近文章

分类

标签

友情链接

其它