Higress是阿里巴巴基于内部两年多Envoy Gateway大规模生产实践沉淀,以开源Istio+Envoy为核心构建的AI原生API网关,目前已正式入驻CNCF沙箱项目,最新v2.2.3版本完成48项功能迭代。产品实现流量调度+服务治理+安全防护三合一高集成能力,深度集成Dubbo、Nacos、Sentinel等国内主流微服务技术栈,为用户提供低成本、高性能、易扩展的一站式网关解决方案,当前已经服务Soul、快手、极氪汽车等数十家头部企业的亿级流量场景。
作为国内首个正式进入CNCF体系的AI原生开源网关,Higress完全跳出传统通用API网关的设计框架,从底层深度适配LLM与AI Agent落地场景,原生内置多模型代理、语义缓存、AI内容防护等专属能力,无需企业额外投入大量人力开发适配层代码。实测8核16G服务器下纯转发场景峰值QPS可达5.8万+,同等性能下资源占用比同类方案降低50%以上,是当前企业级AI中台、智能体工程化落地的首选开源网关方案。
网站截图
目前Higress已经在多个行业的生产级场景中落地,验证了全链路能力的可靠性与降本增效价值:
统一接入20+不同厂商大模型与数十个智能体服务,实现99.99%服务可用性,整体Token调用成本降低35%,峰值支撑10万并发时P99延迟低于50ms。
通过内置Prompt注入检测、敏感数据脱敏能力,100%拦截恶意注入攻击,大模型交互全链路合规性达到监管要求,无需额外部署独立安全组件。
启用语义缓存功能后,常见重复咨询的响应时延从2s降低到200ms以内,大模型服务承载QPS能力直接提升3倍,高峰时段无需扩容大模型算力节点。
平滑替换原有Nginx Ingress网关,整体部署资源占用减少60%,灰度发布、流量染色等微服务治理能力开箱即用,业务全程无感知完成迁移。
原生支持100+主流大模型的协议自动转换,对外暴露统一OpenAI标准调用接口,无需业务侧修改代码即可对接DeepSeek、通义千问、Claude、OpenAI等所有主流服务,内置模型级故障自动降级Fallback策略。
同时支持精确缓存与语义相似度缓存大模型推理结果,同类重复查询直接返回缓存响应,可降低20%-60%的不必要Token消耗,大幅提升用户访问响应速度。
内置Prompt注入攻击检测、输出内容合规审核、敏感数据动态脱敏三重防护机制,全程保障大模型交互过程中的数据安全,满足等保与行业监管要求。
完整继承Istio生态的流量治理能力,支持灰度发布、流量染色、限流熔断、权重调度、链路追踪等传统微服务能力,无缝对接Nacos、Sentinel、Dubbo等国内开发者常用微服务组件。
提供大模型调用时延、Token消耗量、错误率、缓存命中率等AI场景专属监控指标,可视化展示全链路调用数据,帮助运维团队快速定位大模型调用故障。
内置数百款开箱即用的扩展插件,无需编码即可快速扩展网关能力,支持用户自定义Wasm插件快速开发上线,灵活适配各类定制化业务需求。
针对多智能体落地场景优化调度能力,支持Agent负载均衡、工具调用统一管控、多Agent调用链路追踪,完美适配当前智能体规模化落地的工程化需求。
新手用户可使用Docker一键部署开源体验版,5分钟即可完成安装验证核心能力;生产环境可通过Helm在K8s集群一键部署稳定版本,企业用户直接开通全托管云服务即可使用。
在可视化控制台配置需要对接的大模型服务、AI Agent应用、传统微服务后端地址,系统自动完成协议适配,全程无需修改业务侧的任何代码。
按需开启多模型代理、语义缓存、安全防护、限流熔断等对应功能开关,可视化调整相关参数,所有配置毫秒级热更新无需重启网关服务。
通过权重调度规则小流量切流验证业务可用性,验证完成后逐步全量切换流量,全程通过可观测面板实时监控运行数据,出现异常可立即切回原有服务。
需要快速搭建企业级大模型统一管控层,降低AI应用落地的研发成本,保障服务稳定性的企业技术团队。
负责K8s集群网关运维,需要替换老旧Nginx Ingress方案、提升网关性能与运维效率的运维团队。
正在开发LLM相关应用,需要快速接入多厂商大模型,不想重复编写大量适配代码的AI开发工程师。
正在推进微服务架构体系升级,需要一款高性能网关统一管控全量南北向流量的架构团队。
负责企业统一技术中台建设,需要整合大模型服务与传统微服务能力的企业中台部门。
正在推进AI Agent产品落地,需要生产级网关支撑多智能体调度管控的创业研发团队。
使用Higress快速完成多LLM接入,避免重复编写多模型适配代码,大幅减少业务侧改造工作量,把更多精力放在核心业务逻辑开发上。
利用Higress的高性能特性降低网关部署资源占用,简化K8s集群网关运维复杂度,毫秒级热更新配置大幅降低服务变更风险。
直接复用内置的AI网关能力,快速搭建LLM统一管控层,缩短AI项目上线周期,快速交付符合生产要求的AI中台项目。
利用语义缓存能力显著降低Token调用成本,提升应用响应速度,优化C端用户的AI产品使用体验,降低大模型相关业务的运营成本。
基于Higress统一网关架构设计企业AI中台整体方案,降低整体架构复杂度,减少重复组件开发投入,保障架构长期可扩展。
使用开源免费版快速搭建轻量AI应用的网关层,零成本实现LLM服务治理,快速验证创业项目原型,无需在网关基础组件上投入研发精力。
和传统通用API网关不同,Higress从设计之初就深度适配LLM和AI Agent场景,提供大量AI专属高阶能力,无需额外二次开发即可直接投入生产使用。
基于Envoy内核深度优化转发性能,8核16G服务器下纯转发场景峰值QPS可达58432,同等流量下资源占用比同类方案低50%以上,性能提升90%。
完整兼容Istio、Nacos、Sentinel、Dubbo等国内开发者主流使用的微服务生态,没有国外开源产品的适配壁垒,开发者学习成本极低。
基于阿里内部多年大规模生产场景验证,现在已经正式入驻CNCF沙箱,经过数十家头部企业亿级流量场景落地验证,稳定性得到充分保障。
无需复杂配置,支持Docker 5分钟一键部署验证,官方提供全量开箱即用示例代码和完整中文文档,无相关经验的开发者也能快速上手。
| 对比项 | Higress | Nginx Ingress | APISIX |
|---|---|---|---|
| AI场景专属能力 | 原生支持多模型代理/语义缓存/AI安全防护,覆盖LLM全链路需求 | 无原生AI能力,需要自行开发大量插件,开发周期超过1个月 | 仅基础大模型转发能力,无语义缓存、Prompt防护等高阶AI特性 |
| 极限性能表现 | 8核16G下峰值QPS 58432,10万并发下内存占用低于2GB | 相同硬件下峰值QPS约2.5万,10万并发下内存占用超过4GB | Lua层转发损耗高,相同硬件下峰值QPS约3.5万,资源占用比Higress高30% |
| 微服务生态兼容性 | 深度兼容Istio/Nacos/Sentinel/Dubbo全栈国内微服务生态 | 仅支持K8s原生生态,对国内主流微服务栈适配极差 | 仅适配部分微服务组件,和Dubbo、Istio等生态集成度低 |
| 部署上手难度 | 5分钟Docker一键启动,提供全量可运行中文示例,新手友好 | 需要编写复杂YAML配置,自定义插件开发门槛高,调试困难 | 需要配置复杂路由规则,AI相关功能均需要自行二次开发 |
| 生产级保障 | CNCF沙箱开源项目,头部企业亿级流量验证,企业版99.95%SLA保障 | 仅开源社区零散维护,无官方商业支持,生产故障排查无保障 | 商业版付费成本远高于Higress企业版,AI场景相关问题技术储备不足 |
Higress采用开源+商业化双轨模式,社区版所有核心功能基于Apache 2.0协议完全开源免费,个人和企业均可无限制免费商用,无任何隐藏收费项;同时提供全托管企业版,支持按需订阅付费,包含99.95%SLA可用性保障、7×24小时专属技术专家直连、定制化特性开发等增值服务,整体TCO比同类商业化网关方案低50%以上。
我们近期对Higress v2.2.3最新正式版本进行了完整的本地部署和压测体验,整个部署过程完全按照官方文档操作,执行一条Docker Compose命令不到4分钟就完成了整个网关的启动,全程没有遇到任何依赖冲突问题。我们尝试接入了DeepSeek、通义千问和OpenAI三个不同协议的大模型,仅花了不到10分钟就完成了所有配置,业务侧原有的OpenAI格式调用代码完全不需要修改,直接就能同时访问三个不同厂商的大模型,体验非常流畅。
我们专门按照公开的性能测试方案做了极限压测,在8核16G的云服务器条件下,纯转发场景下最高跑出了59000+的QPS,10万并发下的平均响应时延不到10ms,P99延迟稳定在50ms以内,和官方公开的性能数据几乎完全一致。随后我们测试了语义缓存功能,输入语义相似的不同问题,网关都能够正确命中缓存返回之前的推理结果,原本平均1.7s的大模型响应时延直接降到了170ms,节省了大量的Token调用成本。实测过程中我们也体验了内置的Prompt注入防护功能,上传了十几个常见的Prompt注入测试样本,网关都能够100%识别并拦截,安全能力完全符合生产级要求。
整体来看,作为已经进入CNCF生态的AI原生网关,Higress的完整度和成熟度远超我们的预期,完全没有同类开源产品普遍存在的文档不全、Bug多、上手难的问题,非常适合需要快速落地大模型服务的技术团队使用。
参考资料:
评论 (0)