论坛
BBS
默认
简体中文
繁體中文
登录
全球主机MJJ交流论坛
»
论坛
›
主机交流
›
VPS综合讨论
›
做了一个让多台临时 GPU 接力训练同一 checkpoint 的开 ...
返回列表
发新帖
查看:
0
|
回复:
0
做了一个让多台临时 GPU 接力训练同一 checkpoint 的开源项目,招募受控 Beta 测试
[复制链接]
fffffffchopin
fffffffchopin
当前离线
积分
3
1
主题
0
回帖
3
积分
新手上路
新手上路, 积分 3, 距离下一级还需 47 积分
新手上路, 积分 3, 距离下一级还需 47 积分
积分
3
关注TA
发消息
发表于
昨天 15:25
|
显示全部楼层
|
阅读模式
整合大家的闲置算力
CrowdTensor 是一个开源的志愿模型训练协议。每台机器只领取一个有边界的 LoRA work unit ,完成后提交 delta ;机器离开时,Coordinator 保留已经验证的 checkpoint , 之后由其他设备继续。
我们已经完成一次 Qwen2.5-7B/GSM8K 256 步实跑:旧的两组 T4x2 在第 128 步 全部删除,新的两组 Runtime 从中央 checkpoint 恢复并完成剩余训练。当前网站上 也运行着一个 SmolLM2/WikiText-2 Founding Campaign 。
现在是受控工程 Beta ,不是 permissionless 网络,也没有投毒/Sybil 安全或生产 SLA 。想招募愿意测试一个 work unit 、审阅 7B RFC 或检查安全边界的开发者。
网站:
https://crowdtensor.24.199.118.54.nip.io
GitHub:
https://github.com/Ffffffffchopin/CrowdTensor
7B RFC:
https://github.com/Ffffffffchopin/CrowdTensor/blob/main/docs/campaigns/qwen25-7b-gsm8k-rfc.md
Beta 申请:
https://github.com/Ffffffffchopin/CrowdTensor/issues/new?template=beta_enrollment.yml
回复
使用道具
举报
返回列表
发新帖
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖并转播
回帖后跳转到最后一页
浏览过的版块
水池
Archiver
|
手机版
|
小黑屋
|
全球主机MJJ交流论坛
Powered by
Discuz!
X5.0
© 2001-2026
Discuz! Team
.
在本版发帖
返回顶部
快速回复
返回顶部
返回列表