论坛
BBS
默认
简体中文
繁體中文
登录
全球主机MJJ交流论坛
»
论坛
›
主机交流
›
VPS综合讨论
›
做了一个极简的纯 Java 实现的 LLM 推理引擎,支持 Page ...
返回列表
发新帖
查看:
3
|
回复:
0
做了一个极简的纯 Java 实现的 LLM 推理引擎,支持 PagedAttention,前缀缓存,连续批处理和分块预填充
[复制链接]
jingzhou
jingzhou
当前离线
积分
3
1
主题
0
回帖
3
积分
新手上路
新手上路, 积分 3, 距离下一级还需 47 积分
新手上路, 积分 3, 距离下一级还需 47 积分
积分
3
关注TA
发消息
发表于 2026-7-15 21:19:47
|
显示全部楼层
|
阅读模式
做了一个极简的纯 Java 实现的 LLM 推理引擎,实现了现代推理服务系统的核心技术:分页 KV cache ( PagedAttention )+ 前缀缓存( Prefix Caching )+ 连续批处理( Continuous Batching )+ 分块预填充( Chunked Prefill )+ 抢占恢复。全部代码约 1.5K 行,依赖极少,适合入门学习;纯 CPU 推理,用 Java Vector API 做 SIMD 加速。灵感来源于 nano-vllm 。
目前支持 Qwen3 dense 系列模型——已用 Qwen3-0.6B 和 HuggingFace transformers 的 greedy 输出做过逐 token 完全一致的对齐验证。
欢迎对大模型推理感兴趣的朋友试用:
https://github.com/oujingzhou/vllm4j
欢迎 star
回复
使用道具
举报
返回列表
发新帖
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖并转播
回帖后跳转到最后一页
浏览过的版块
水池
Archiver
|
手机版
|
小黑屋
|
全球主机MJJ交流论坛
Powered by
Discuz!
X5.0
© 2001-2026
Discuz! Team
.
在本版发帖
返回顶部
快速回复
返回顶部
返回列表