Streamable HTTP
1. 3 秒看懂
- 是什么:一套基于 HTTP 协议、利用标准流式机制(Server-Sent Events、分块传输等)实现多模型、多工具链式协同的架构范式。它并非全新协议,而是将模型推理过程“链路化”,并以流式、异步的方式向客户端实时返回每一步中间结果与最终答案。
- 技术路径:将复杂 AI 任务拆解为一组可编排的原子步骤,通过 HTTP 长连接持续推送模型输出、工具调用状态与阶段性成果,可在本地轻量模型与云端大模型之间动态路由与并行调度。
- 产业价值:让“模型即插件”成为现实,显著降低多步推理应用的构建门槛;推动 AI 应用走向模块化、专业化分工,催生围绕模型链的编排、安全、计费、观察性等新职能,加速 Agent 形态产品落地。
2. 3 分钟产业解释
Streamable HTTP 的核心思想是将大模型的推理过程“流水线化”:一次用户请求不再由单一模型一次性处理,而是被编排引擎拆解为多个子任务,分别交给不同的模型、工具或数据源,并以实时“流”的方式将每一步进展呈现给用户。例如,一个法律咨询请求可能经过以下链条:轻量意图识别模型判断咨询类型→调用法律条文检索工具→云端大模型依据检索结果生成初步答案→另一个风格化大模型将答案润色为通俗语言,全程通过 HTTP 的流式通道推送,使终端用户可以逐字、逐段地看到思考过程,而不是黑箱等待。
其产业意义体现为三个层面:
- 用户体验重构:流式链式架构可将首次响应时间压缩至毫秒到秒级(行业估算,2024 年应用平均 TTFT 约为传统同步请求的 1/5~1/10),让 AI 应用具备“实时对话感”,提升信任与留存。
- 成本与性能平衡:允许企业将敏感、轻量任务保留在本地或边缘小模型处理,云端大模型仅负责复杂推理,从而在推理质量和计算费用之间取得最优平衡。据云厂商公开案例(2024),混合调度可节省 30%~60% 的大模型调用成本。
- 产业分工深化:催生出模型编排中间件、链式调用审计网关、流式监控平台等新玩家,推动 AI 架构从单体模型向可组合的“模型微服务”演进,与“人工智能+”行动中鼓励场景创新和模型柔性的政策方向高度契合。
需要澄清的是,Streamable HTTP 并非 IETF 定义的标准协议,而是行业对这套“基于 HTTP 流式传输的链式 AI 调用风格”的统称。其底层依赖早已成熟的 SSE(Server-Sent Events)、HTTP/1.1 分块传输编码(chunked transfer encoding)以及 HTTP/2 多路复用技术,只是在上层应用模式上形成了可复制的设计范式。
3. 技术原理
Streamable HTTP 的运转由三个技术基座支撑:流式传输通道、链式任务编排引擎,以及模型-工具混合调度器。
流式传输通道:最常用的实现是 SSE(Server-Sent Events)+HTTP POST 的组合。客户端通过普通 HTTP 请求发起一个链式任务,服务器在响应头中设置 Content-Type: text/event-stream,并持续写入符合 SSE 格式的数据帧。每次子任务完成或模型生成新 token 时,就推送一个事件,前端可即时渲染。相比 WebSocket,SSE 更轻量、天然支持自动重连,且经过 CDN 和代理服务器广泛支持,成为链式流式交互的事实首选。部分实现也采用 HTTP/2 的全双工帧(如 gRPC 流)或 NDJSON(新行分隔 JSON)流作为传输层,但核心模式不变。
链式任务编排:编排引擎通常运行在云端网关或无服务器函数中,负责解析用户意图、执行预定义的 Chain(有向无环图)。每个 Chain 由一系列节点组成:模型节点(调用某个大模型)、工具节点(调用外部 API 或数据库)、逻辑节点(条件判断、循环)、转换节点(格式整理)。例如,一个“客服-订单查询”链条可能定义为:① 文本分类模型 → ② 若类别为“订单”,调用订单查询工具 → ③ 大模型将查询结果包装成礼貌回复。引擎按照 DAG 驱动执行,并将每个节点的输出实时转化为 SSE 事件推送。当节点执行过程中发现需要附加信息时,也可以通过 SSE 向客户端请求上下文(如要求用户确认操作),形成半双工交互。
模型-工具混合调度:为了平衡延迟、成本和能力,调度器会根据模型标签(如“轻量意图识别”“强推理”“多模态”)、当前负载、成本预算和网络条件,动态选择最佳的模型端点。例如,初次意图分类可能调用一个仅 0.5B 参数的端侧模型,而复杂推理则路由到云端千亿参数大模型。工具调用则遵循 OpenAI 推出的 function calling 规范或类似协议,在 SSE 流中发送带 tool_calls 的事件,编排引擎暂挂当前链,执行完工具后将结果注入上下文继续串流。Anthropic 的 Tool Use、Google 的 Gemini Function Calling 均兼容类似设计,而标准化接口(如 2024 年末公布的 MCP/A2A)正试图统一不同厂商的工具接入和 Agent 间通信协议,进一步降低混合调度的集成成本。
4. 关键参数
衡量 Streamable HTTP 架构的关键技术指标与产业观测值如下(数据截至 2025 年初,部分为行业估算或公开基准测试):
- 首次生成时间(Time-To-First-Token, TTFT):在链式流式架构中,引擎可在第一个模型生成首 token 前就发出预处理状态事件(如“正在分析意图…”),因此用户感知的“首 token”可低至 200~500 毫秒。OpenAI GPT-4o mini 流式 API 在典型网络下的 TTFT 中位数约 300 ms(OpenAI 官方博客,2024 年 7 月);国内大模型 API 公开测试显示,千问 Turbo 流式 TTFT 平均在 200 ms 左右(阿里云官网性能白皮书,2024)。
- 端到端生成延迟:虽然流式首字极快,但完整生成时间受链条长度和模型推理速度约束。一个包含 3 步串行调用的链,整体延迟通常为各步骤延迟之和加上网络与编排开销(约 50-200 ms)。在标准测试中,一条“问题分类→知识检索→答案生成”的链式应用,端到端平均延迟约 2.5 秒(LangSmith 公开性能数据,2024 年 10 月,抽样 N=10k),其中大模型推理占主导。
- 上下文窗口长度:链式调用可在步骤间传递大量上下文,因此模型的上下文窗口至关重要。2024 年主流商用大模型的上下文长度普遍在 128K~200K tokens(例如 GPT-4 Turbo 128K,Claude 3 200K,Gemini 1.5 Pro 128K;国产模型千问-Max 开放 30K,百川 3 支持 128K)。长窗口允许链式调用携带更长的历史与工具输出,避免遗失信息。公开资料显示,2025 年初部分旗舰模型已突破 256K。
- 最大链长度:编排引擎允许的串联步数,主流框架(LangChain、阿里百炼工作流)通常支持数十到上百个节点,但实际受限于总令牌消耗和延迟预算。LangChain 框架未硬性限制链条长度,工程实践中多控制在 5~10 个主要步骤以内,以维持可调试性(社区调研,2024)。
- 并发连接数与吞吐:单台中等规格云主机(4 vCPU,8 GB 内存)基于 Nginx 反向代理可轻松维持数万个 SSE 长连接;当链式任务包含大量阻塞等待模型推理时,并发能力受后端模型 API 速率限制。主流模型 API 并发限制从数十到数百 QPS 不等(例如 OpenAI 对企业客户默认 Prompt API 速率 500 请求/分钟,2024 年,可申请提升)。
- 成本指标:一次链式调用的成本为各步骤模型调用成本与工具调用费用之和。按 2024 年公开定价,以 OpenAI GPT-4o 为例,输入 $5/1M tokens,输出 $15/1M tokens;阿里云 Qwen-Plus 调用 $0.0008/千 tokens(输入)。假设一条链包含 500 输入 tokens + 800 输出 tokens,主模型费用约 $0.007(GPT-4o);外加轻量模型和工具调用,总成本可控制在 $0.01 上下。混合调度将轻量任务切给便宜模型可进一步降低 40% 以上(LangSmith 成本分析案例,2024)。
- 可靠性指标:链式调用引入额外的失败点,端到端成功率 = 各节点成功率之积。若单模型 API 可用性为 99.9%,3 步链条成功率即降至 ~99.7%。业界通过重试、降级(换小模型)、缓存等机制将端到端成功率提升至 99.5% 以上(云厂商内部 SLA 目标,公开资料未见)。
5. 技术路线
围绕 Streamable HTTP 的落地,业界形成了四条主要技术路线,彼此交叉但有明显差异:
路线一:轻量级 SDK 框架(LangChain/LlamaIndex/Semantic Kernel)
开源框架封装了 Chain 和 Agent 抽象,提供统一的模型接口、工具调用、记忆管理,并原生支持 SSE 流式回调。开发者通过 Python/JS 编码定义链,框架在调用模型时自动打开流式通道并处理分块解析。优点:灵活、生态丰富、可集成任意模型;缺点:需要自行处理部署、扩展和状态管理。代表:LangChain(GitHub 90k+ Stars)、Semantic Kernel(微软,支持 C#/Python)、LlamaIndex(侧重数据索引)。目前 LangChain 生态的 LangServe 可将 Chain 直接发布为 HTTP 流式端点,LangSmith 提供可观察性。
路线二:云厂商低代码/无代码编排平台
阿里云百炼、百度智能云千帆、腾讯云 TI 平台均推出可视化工作流编辑,支持拖拽节点编排 Chain,一键生成流式 API。后台自动将工作流编译为 Serverless 函数+消息队列架构,通过 API 网关暴露 SSE 接口。优点:降低编码门槛、与云上模型/算力无缝集成、自带监控和日志;缺点:技术锁定风险、可定制性受平台约束。此类平台通常内嵌最佳实践(如自动降级、缓存策略),适合企业快速搭建应用。据公开案例,百炼工作流上线后,某零售企业客服应用开发周期从 3 周缩短至 3 天(阿里云官网,2024 年 12 月)。
路线三:Agent 通信协议标准化
为避免每个链式应用都重新造轮子并解决跨系统互操作问题,Anthropic 于 2024 年 11 月发布 Model Context Protocol (MCP),定义了模型如何与工具/上下文交互的统一协议;Google 在 2024 年 12 月发布 Agent-to-Agent (A2A) 协议草案,聚焦多 Agent 协作场景的信息交换。二者均基于 HTTP 和 SSE 作为传输层,试图成为链式调用的事实标准。路线优势:打通不同模型与工具壁垒,降低集成成本;挑战在于推动全行业采纳,尚处早期。OpenAI 的函数调用规范因先发优势已广泛被工具厂商支持,但与 MCP/A2A 存在竞合关系。
路线四:自研中间件(基于事件驱动架构)
具备较强工程能力的团队选择自建编排层:使用 Kafka/Redis Streams 作为异步事件总线,将链式任务拆解为多个微服务工作流,边缘服务通过 SSE 汇总后推送至客户端。例如,前端建立 SSE 长连接连接网关;网关向 Kafka 投递链式任务命令,各微服务消费后通过另一个主题回传部分结果,网关组装为 SSE 事件流。优点:极致可扩展性、与现有技术栈契合;缺点:开发和运维成本高,仅适用于成熟平台型企业。部分大厂(如字节跳动内部实践)和大型金融机构采用此模式构建高并发 Agent 平台。
演进趋势:实践表明,技术选型往往分层组合——SDK 框架用于原型和中小应用,编排平台用于批量生产,Agent 协议用于跨生态协作,中间件用于超大规模系统。随着 2025 年 MCP/A2A 等协议趋于成熟,可能会进一步收拢碎片化状态。
6. 上游(基础设施与供给端)
Streamable HTTP 架构依赖一系列上游能力,构成完整的供应生态。
算力提供商:链式调用对推理延迟和弹性伸缩要求苛刻,直接拉动对 GPU 云服务和边缘推理节点的需求。主要供应商包括 AWS(SageMaker、Bedrock)、Microsoft Azure(Azure AI)、Google Cloud(Vertex AI)、阿里云(PAI)、百度智能云(千帆底座)、腾讯云等。据公开资料,2024 年中国新建智算中心超过 50 个,总算力规划超 200,000 PFLOPS(工信部相关报告),这些中心通过提供低延迟区域推理服务,支撑本地+云端链式调度。此外,边缘算力的重要性上升,例如模型量化后在手机 SoC 或 IoT 芯片上运行意图识别小模型,再通过 HTTP 长连接流式调用云端大模型,代表芯片包括高通骁龙 8 Gen 3(搭载 AI Engine)、苹果 A17 Pro 等。
基础模型厂商:链式调用需要多样化模型库,按能力梯度分为:
- 轻量嵌入模型 / 分类模型(常用于第一步):Qwen2.5-0.5B、Gemma、MiniLM 等,多数提供 HTTP 推理 API。
- 云端千亿参数推理主力:OpenAI GPT-4 系列、Anthropic Claude 3/4、Google Gemini 2.0、Meta Llama 3(通过 Together/Azure 托管)、百度文心 4.0、阿里通义千问 2.5、腾讯混元、智谱 GLM-4、百川 3 等。厂商普遍提供兼容函数调用的流式 API,并持续降价(例如 OpenAI 自 2023 年起多次下调 GPT-4 价格,2024 年 GPT-4o 比初代 GPT-4 价格下降 50% 以上)。
- 多模态模型:用于处理图像/音频/视频的链式步骤,如 GPT-4o、Gemini 1.5 Flash、千问 VL 等,提供多模态流式 API,支持输入图像并返回文本流。
- 代码/推理专用模型:用于链中自动编码或逻辑校验步骤,如 DeepSeek-Coder、Code Llama 等。
模型服务平台与聚合器:为了集成多种模型,统一计费和路由,涌现了一批 MaaS(模型即服务)平台,包括 Hugging Face Inference Endpoints、Replicate、Together AI、Groq、国内硅基流动等。它们通常提供统一的类 OpenAI 请求格式和流式响应,简化链式调用中的模型切换。据公开信息,2024 年 Groq 的 LPU(语言处理单元)推理在流式场景下展示了高速生成性能,TTFT 可低至几十毫秒,对用户体验影响显著。
数据与工具生态:链式调用需要的工具和数据源构成了上游另一环节。包括向量数据库(Pinecone、Milvus、Weaviate)、搜索引擎 API(Google Search、Bing Search API)、企业软件 API(Slack、Salesforce、Jira)以及专用数据处理服务(Scale AI、Surge AI 等提供链式调用的合成数据生成服务,以测试和优化链条)。MCP 协议推出后,工具提供商若实现 MCP 接口,即可被任何支持 MCP 的编排引擎“即插即用”,形成上游标准化供给。
7. 下游(应用场景与终端)
Streamable HTTP 链式架构正被嵌入到一系列应用中,重塑产品形态和用户习惯。主要场景包括:
智能客服与对话式分析:电商、金融领域客服利用链式调用整合意图识别、情绪分析、订单/账户查询、知识库检索、回复生成等多个环节,实时流式推送给客户。例如,某银行信用卡助手(2024 年公开案例)在用户说“我的信用卡丢了”后,链式执行:识别意图→核身模型请求→调用系统挂失 API→生成安抚话术,中间每一步都通过 SSE 向用户反馈状态,如“正在验证身份…”“已成功挂失,为您制作新卡…”,效度和满意度显著优于传统静默等待。
AI 编程助手:GitHub Copilot Chat、Cursor、通义灵码等采用流式链式架构,在代码补全中融合上下文理解、代码库检索、安全扫描模型等。典型链为:用户问题→代码检索工具→大模型生成补全片段→代码审查小模型检查安全与风格→流式返回建议。流式传输让开发者即时看到行级更新,感受“实时结对编程”。
自主 Agent 系统:以 AutoGPT、MetaGPT、微软 AutoGen 为代表的多智能体框架,本质上就是复杂的流式链式调度。一个“市场调研”Agent 可能链式调用:搜索工具→摘要模型→比较模型→生成图表工具→最终报告模型,各步骤通过 SSE 向用户界面推送中间进度,使用户可介入修正方向。在企业内部,此类 Agent 正应用于自动化报告生成、SOP 流程执行等,Streamable HTTP 支撑了其及时反馈和可监督性。
沉浸式互动内容:游戏 NPC 对话、虚拟主播等场景要求句级甚至词级的实时生成。链式调用前段用情感识别模型判断玩家语气,中段调用对话大模型生成内容,后段由文本转语音模型(TTS)流式合成语音,整个管道在 HTTP 上形成“流式级联”,延迟控制在 1 秒以内。部分 VR/AR 应用则结合视觉模型,实时理解场景后链式生成指引或旁白,对 HTTP 持久连接和低延迟流要求极高。
企业 RPA 与流程自动化:传统 RPA 规则僵化,引入链式大模型调用后,可将自然语言指令转化为 API 调用序列,并通过链式流式返回执行日志。例如“帮我整理上周所有销售超过 10 万的客户清单并发送邮件”,系统链式执行:NL2SQL 模型→数据库查询→表格数据处理模型→邮件草案生成模型,用户可实时审阅中间结果并一键确认,极大提升自动化柔性。UiPath、Automation Anywhere 等厂商已在其 2024 年产品路线图中展示类似集成。
医疗/法律等垂直专业领域:在医疗预问诊中,链式流程负责任务分解:症状收集(轻量对话模型)→知识库检索(医学知识图谱)→初步分诊建议(专用模型)→人工审核。全程流式显示,让医患互动透明。法律文档审查中,链式调用结合多语言翻译模型、条款比对模型和风控模型,将数小时的合同审查压缩至几分钟,并通过流式高亮标注关键条款。这些场景对安全合规有极高要求,也驱动了链式调用的私有化部署趋势。
8. 受益公司与组织
Streamable HTTP 链式架构的普及,可能使以下类型的企业和组织在业务增长、效率提升或生态位获取方面受益(以下基于公开业务逻辑分析,不构成任何投资建议):
- 云计算与 AI 平台厂商:AWS、微软 Azure、阿里云、百度智能云、腾讯云等,通过提供模型编排低代码平台及底层流式推理服务,有助于增加客户粘性和推理 API 调用量。以阿里云为例,百炼平台工作流产品于 2024 年 12 月走出公测,直接拉动千问系列 API 用量;微软 Azure AI Studio 中的 Prompt Flow 工具允许组合流式链,推动 Azure OpenAI 服务的消耗。这些平台的计费模型(按 token / 节点执行时间)令其直接受益于链式调用带来的多步组合调用增量。
- 开源框架及其商业孵化:LangChain 背后的 LangChain Inc. 推出 LangSmith 监控平台和 LangGraph Cloud 托管服务;LlamaIndex 提供 LlamaCloud 托管检索与链式服务。随着链式应用从开发走向生产,企业对可观察性、安全网关、持久化记忆等需求上升,为框架的商业化产品提供市场机会。据公开信息,LangChain 在 2024 年完成 B 轮融资,估值反映市场对编排层的预期。
- 工具/数据接口提供商:Zapier、Wolfram Alpha、SerpApi 等工具提供商,通过兼容 MCP 或 function calling 成为链式调用的标准“插件”,有望获得更多开发者的集成,从而扩大 API 调用量。拥有专有数据源的企业(如金融数据 Bloomberg、舆情监测 Meltwater、医疗文献 PubMed 等)也在将自身封装成可被链式调用的工具端点,开辟新的数据变现渠道。
- 应用方案集成商与 SaaS 企业:在 CRM(Salesforce Einstein GPT)、ITSM(ServiceNow)、办公协作(微软 Copilot、飞书智能伙伴)等领域,流式链式调用正在成为高级功能的标配。这些厂商可将自身工作流引擎与链式模型编排结合,向上游客户交付端到端智能流程,提升每用户平均收入(ARPU)。例如,微软 365 Copilot 利用 Semantic Kernel 编排链式技能,将大模型与 Graph API 深度结合,增加微软 365 的企业价值。
- 边缘 AI 芯片与设备厂商:高通、联发科、苹果等移动芯片厂商,以及 IoT 模组企业,受益于“云边端”协同链架构的铺开:端侧小模型触发流式云调用成为新卖点。高通在 2024 骁龙峰会上重点宣传了设备端模型与云端大模型的无缝交接能力,推动搭载其芯片的旗舰手机支持更多即时性 AI 体验。
- 国内初创与模型企业:智谱 AI(推出 AutoGLM Agent 链)、百川智能(提出“Chain of Agents”架构)、月之暗面(Kimi Chat 加入流式长链检索)、面壁智能(端侧模型与云端协同)等,通过在链式调用上构建差异化能力,寻求在与大厂的竞争中获得身位。公开资料显示,2024 年智谱 GLM-4 系列内部已全面支持工具链编排,赋能战略合作伙伴。
9. 市场规模与增长前瞻
Streamable HTTP 链式调用并非独立统计的市场,其规模内嵌于更广口径的 AI 软件、Agent 和 MaaS 市场。以下基于公开报告对相关细分市场的预测进行估算,并注明口径与来源。
- 全球 AI 软件市场:IDC 2024 年预测,全球 AI 软件(包括 AI 平台、应用、系统基础设施软件)市场规模将在 2028 年达到约 4000 亿美元(2023 年为 1279 亿美元),2023–2028 年复合年增长率 (CAGR) 约 25.6%。其中,涉及模型训练、推理和编排的平台部分占据约 20%–25% 比例(IDC 分类)。链式调用作为推理编排的高级形态,与模型服务平台、Agent 框架密切相关,属于该范围内的高增长子集。
- AI Agent 市场:Grand View Research 于 2024 年发布的报告估算,全球自主 AI 和 Agent 市场在 2023 年为 46.1 亿美元,预计 2024–2030 年将以 42.8% 的 CAGR 扩展,至 2030 年达到约 575 亿美元。链式调用是构建自主 Agent 的核心技术,其需求与 Agent 市场规模强关联。据 Gartner 2024 年 AI 趋势调查,40% 的企业计划在 2025 年前部署某种形式的 Agent 自动化,流式链式编排是基础能力。
- MaaS(模型即服务)市场:MarketsandMarkets 2024 年报告指出,全球模型即服务市场(含 API 推理、模型托管、编排服务)2023 年规模为 64 亿美元,预计 2028 年增至 346 亿美元,CAGR 40.1%。其中,模型组合编排(Chaining)和流式传输被列为主要增长动力之一。中国信通院在 2024 年发布的《MaaS 平台技术要求》中已将模型组合编排能力纳入核心评估项,直接映射到链式调用领域。
- 中国市场洞察:IDC 中国 2024 年报告显示,2023 年中国人工智能软件市场规模为 107.6 亿元人民币,预计 2028 年达到 441.6 亿元,CAGR 32.6%。大模型平台及应用(包括 Agent 框架工具)是增长最快的子市场。据公开会议信息,2024 年中国信通院联合多家企业正在制定“新一代 AI 应用编排”相关标准,反映出市场从模型能力向工程化编排延伸的态势。
- 开发者经济指标:虽然公开资料未见针对流式链式 HTTP 调用的独立付费统计,但从 API 数据可侧面感知。OpenAI 在 2024 年 11 月表示已有超过 300 万开发者使用其 API,流式请求占比据工程师社区估计超过 60%(非官方)。LangChain 月下载量在 2024 年 12 月超过 2000 万次(PyPI 数据),从一个侧面反映链式编排引擎的采用速度。
综合以上,Streamable HTTP 链式架构所覆盖的市场(MaaS 编排、Agent 平台、相关工具链)在 2024 年全球规模估计在数十亿美元量级,预计到 2028–2030 年将以年复合 35%–45% 的速度增长,成为 AI 基础设施领域的关键增长极。
10. 主要玩家与方案对比
下表对当前活跃的 Streamable HTTP 链式调用相关方案进行横向对比,聚焦于流式协议支持、编排抽象、工具生态和适用规模。所有信息基于 2025 年初公开文档与官方公告。
| 玩家/方案 | 类型 | 流式协议支持 | 编排抽象 | 工具/模型生态 | 可靠性与可观察性 | 典型适用场景 |
|---|---|---|---|---|---|---|
| LangChain + LangServe | 开源框架 | SSE (aiohttp/FastAPI) | Chain, Agent, Graph (LangGraph) | 海量集成(OpenAI, Anthropic, Google, 百+工具) | 通过 LangSmith 提供追踪与评估 | Python/JS 应用中定制化链式应用;中小到复杂 Agent |
| Semantic Kernel (微软) | 开源 SDK | SSE (ASP.NET Core) | Plugin, Kernel, Planner | 微软生态(Azure AI, OpenAI), 可扩展 | 依赖 Azure Monitor/Application Insights | .NET 与 Python 企业应用;与 M365 Copilot 深度集成 |
| 阿里云百炼工作流 | 云平台 | SSE(API 网关) | 可视化 DAG 工作流, DSL | 阿里系模型(千问)及主流第三方,工具少 | 平台自带日志、监控、告警 | 无代码/低代码企业应用;国内高并发场景 |
| 百度智能云千帆 AppBuilder | 云平台 | SSE(API 网关) | 工作流、Agent 画布 | 文心系列模型及自定义插件 | 平台监控,部分开源监控集成 | 中文场景 Agent 开发;与百度搜索生态结合 |
| Google Agent-to-Agent (A2A) | 协议标准 | SSE / HTTP | 不直接提供编排,强调 Agent 通信 | 较新,初期基于 Google 模型和合作伙伴 | 待定 | 跨组织、多 Agent 互操作;供应链、多方协作 |
| Anthropic MCP | 协议标准 | SSE | 工具/上下文接入标准 | Anthropic Claude、B 端工具先行 | 待框架实现 | 统一模型-工具接口;降低集成负担 |
| 自研中间件(事件驱动) | 定制化 | SSE 聚合 + Kafka | 自定义流程引擎 | 全定制 | 自建观测栈 (Prometheus/Grafana) | 超大规模互联网平台、金融核心系统 |
此对比体现不同方案的侧重:框架/平台注重开发效率和托管运维,协议标准试图打通互操作,自研中间件追求极致可控。实践中,企业常组合多种方式,例如用 LangChain 开发链逻辑,通过阿里百炼暴露 API,同时遵循 function calling 规范确保工具兼容。
11. 风险与挑战
Streamable HTTP 链式架构带来灵活性,也伴随多重风险:
安全攻击面扩大:每一步模型交互、工具调用都可能成为攻击入口。提示注入(Prompt Injection)风险由单体模型扩展到全链:恶意输入可以渗透到工具