windsing 在 [慢讯]阿里海外实验室微调Qwen3.6-35B-A3B,比肩deepseek/glm等更大模型 中发帖
阿里巴巴旗下的 AI 研发团队Accio-Lab微调Qwen3.6-35B-A3B,比肩deepseek/glm等更大模型。
训练方式:
Qwen3.6-35B-A3B
├─ Marathon Expert: SFT → HDPO ┐
└─ Sprint Expert: SFT ├─ Uniform merge → SAO → Occamy-1.0
SFT 数据集加起来只有 4.033 亿 Token,分布在不到 1.5 万条轨迹里,而且全都是 Agent 方向的(工具调用、终端操作、长流程任务)。所以agent相关性能提升可能比较显著,但世界知识和非agent方面可能没太大提升。
[image]
[image]