查看: 3|回复: 0

做了一个极简的纯 Java 实现的 LLM 推理引擎,支持 PagedAttention,前缀缓存,连续批处理和分块预填充

[复制链接]

1

主题

0

回帖

3

积分

新手上路

积分
3
发表于 2026-7-15 21:19:47 | 显示全部楼层 |阅读模式
做了一个极简的纯 Java 实现的 LLM 推理引擎,实现了现代推理服务系统的核心技术:分页 KV cache ( PagedAttention )+ 前缀缓存( Prefix Caching )+ 连续批处理( Continuous Batching )+ 分块预填充( Chunked Prefill )+ 抢占恢复。全部代码约 1.5K 行,依赖极少,适合入门学习;纯 CPU 推理,用 Java Vector API 做 SIMD 加速。灵感来源于 nano-vllm 。

目前支持 Qwen3 dense 系列模型——已用 Qwen3-0.6B 和 HuggingFace transformers 的 greedy 输出做过逐 token 完全一致的对齐验证。

欢迎对大模型推理感兴趣的朋友试用: https://github.com/oujingzhou/vllm4j 欢迎 star
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部