在Windows上运行rl-swarm并不是非常完善,可能需要一些调试才能正确设置。您需要先在Windows机器上安装WSL和Linux。
打开PowerShell或命令提示符(以管理员身份运行)
执行以下命令安装WSL和Ubuntu发行版:
wsl --install重启计算机
首次启动WSL时,您需要设置Linux用户名和密码
打开WSL终端(可以通过开始菜单或在命令提示符中输入
wsl)更新软件包列表:
sudo apt update && sudo apt upgrade -y安装Python和其他必要的工具:
sudo apt install python3 python3-pip python3-venv git curl -y
由于Ubuntu系统默认安装的Node.js 12.22.9版本过旧,不兼容rl-swarm需要的js-cookie@3.0.5,您需要手动升级Node.js到v14+版本:
移除旧版Node.js(推荐但可选):
sudo apt remove nodejs npm sudo apt autoremove添加NodeSource仓库(安装Node.js 22.x LTS版本):
curl -fsSL https://deb.nodesource.com/setup_22.x | sudo -E bash -安装Node.js:
sudo apt-get install -y nodejs验证安装:
node -v # 应显示v22.x.x npm -v
在WSL终端中执行:
git clone https://github.com/gensyn-ai/rl-swarm.git
cd rl-swarm
rl-swarm使用一个交互式的安装脚本,该脚本会引导您完成安装过程。
在项目目录中执行:
./run_rl_swarm.sh
安装脚本会执行以下操作:
验证您的环境是否满足要求
安装必要的Python依赖项
设置和配置rl-swarm
在安装过程中,当询问您是否确认时,按下Enter键或输入'Y'继续。
安装完成后,rl-swarm会在本地启动一个Web界面,默认情况下您需要手动导航到http://localhost:3000/(如果您在虚拟机上运行,则需要手动导航到此URL)。
如果您在CPU上运行模型并遇到Python RuntimeError,或者训练进度似乎停止了,可以尝试以下解决方法:
设置实验性修复:
export PYTORCH_MPS_HIGH_WATERMARK_RATIO=0.0 && ./run_rl_swarm.sh在设备配置文件中添加训练参数: 编辑
./hivemind_exp/configs/<与您设备相关的目录>/grpo-qwen-2.5-0.5b-deepseek-r1.yaml添加参数:max_grad_norm=0.5使用floating point 32而不是bfloat16来训练模型。这可以在设备配置文件中更改。
rl-swarm是一个完全开放和无需许可的系统,这意味着您可以在家中的基本消费级笔记本电脑上或云中的强大GPU上运行它。 运行节点后,您可以启动新的群组或加入现有的群组。
rl-swarm使用Hivemind进行分布式训练,让不同节点上的模型可以协作学习和改进。
rl-swarm的Windows支持不如Linux完善,可能需要进行一些调试。
如果您有多个GPU,想要在一台机器上运行多个节点,需要手动调整配置。
不同机器之间的训练速度可能不同,这是正常的。

