Image Image
服务热线 400-098-8505
售前咨询 购买问题咨询
售后服务
在线售后支持
Image

长按或截图扫码

获取1V1专业服务

分布式动态缓存 KVCache

分布式动态缓存KVCache 是京东云推出的一种用于加速大模型推理的高效缓存存储(KVCache存储),通过智能缓存模型中间结果,显著加速多轮推理响应,优化推理时延,降低计算开销,提升系统吞吐与用户体验。为大模型推理提速,是高效AI服务的性能引擎。

分布式动态缓存KVCache 是京东云推出的一种用于加速大模型推理的高效缓存存储(KVCache存储),通过智能缓存模型中间结果,显著加速多轮推理响应,优化推理时延,降低计算开销,提升系统吞吐与用户体验。为大模型推理提速,是高效AI服务的性能引擎。

产品特性

Image
推理加速

KVCache存储显著加速多轮推理响应,支持长对话与超长上下文延续,提升系统吞吐与用户体验。

Image
降本增效

降低GPU占用,有效提升GPU等计算资源利用率,成本节省超30%以上。

Image
部署灵活

支持公有云、托管和私有化部署方式,满足不同业务形式的需求,提供加速服务,降低存储成本。

Image
兼容易用

支持多种访问方式,兼容京东言犀及其他的大语言框架,能够在不同的推理场景中使用,满足对KVCache的多样化访问需求。

应用场景

基于大模型对话推理场景
基于大模型多模态推理场景
基于大模型智能体的行业应用场景
更多
基于大模型对话推理场景
基于大模型多模态推理场景
基于大模型智能体的行业应用场景
基于大模型对话推理场景
Image
基于大模型对话推理场景

以存代算,先存储数据,在 KVCache 命中时,有效降低 GPU计算量;根据统计命中率大约在 40~70%;即在预填充阶段可以节省 40~70% 的算力。同时首 Token 延迟降低 60%以上。

场景介绍
以存代算,先存储数据,在 KVCache 命中时,有效降低 GPU计算量;根据统计命中率大约在 40~70%;即在预填充阶段可以节省 40~70% 的算力。同时首 Token 延迟降低 60%以上。
基于大模型多模态推理场景
Image
基于大模型多模态推理场景

借助高性能且可水平扩展的 KVCache 存储,可在文生图、文生视频等多模态推理场景中,有效支撑批量图片生成及长序列视频帧处理过程中的高并发请求,显著提升系统吞吐率与响应效率。

场景介绍
借助高性能且可水平扩展的 KVCache 存储,可在文生图、文生视频等多模态推理场景中,有效支撑批量图片生成及长序列视频帧处理过程中的高并发请求,显著提升系统吞吐率与响应效率。
基于大模型智能体的行业应用场景
Image
基于大模型智能体的行业应用场景

在医疗体检报告分析场景中,通过KVCache存储方案,大量缓存医学体检知识,结合插件技能,快速实现体检报告分析,输出体检报告的速度提升了百倍。满足单次万级以上Token的需求,有效提升医疗行业应用场景下的应用效能。

场景介绍
在医疗体检报告分析场景中,通过KVCache存储方案,大量缓存医学体检知识,结合插件技能,快速实现体检报告分析,输出体检报告的速度提升了百倍。满足单次万级以上Token的需求,有效提升医疗行业应用场景下的应用效能。

开始与售前顾问沟通

可直接拨打电话 400-098-8505转1

我们的产品专家为您找到最合适的产品/解决⽅案

在线咨询 5*8⼩时

1v1线上咨询获取售前专业咨询

点击咨询
企微服务助手

专业产品顾问,随时随地沟通

Image
0
在线咨询
Image
您好,欢迎使用京东云在线服务
在线中

服务热线:400–098-8505

可直接拨打售前电话:400-098-8505转1

添加企业微信
1V1服务,还有优惠惊喜
Image

加微咨询活动细节,更有千元优惠券好礼

回到顶部