zefa[诚寻] 具身智能创业团队,想认识有千卡级大模型训练经验的佬友 ^_^ 中发帖

我们是一个做具身智能方向的初创团队,目前已经有比较成熟的 硬件平台 、 数据体系 、融资与算力资源 ,接下来准备进一步补齐大模型这一块的核心能力,所以希望认识真正做过大规模训练的佬友 😁 
我们想找的不是单纯调 API、RAG 或常规 LoRA 微调方向,更希望你:


深度参与过 LLM / VLM 等基座模型的 Pre-training / Continued Pre-training / Post-training;


实际跑过千卡级 GPU 集群,最好对大规模训练中的并行策略、吞吐优化、训练稳定性、故障恢复、数据 Pipeline、Checkpoint 等问题有实战经验;


最好曾经作为核心成员参与过一个业内有一定影响力、公开知名度或实际用户规模的模型;


对 Scaling、数据、训练 Infra、模型能力之间的关系有自己的判断,而不只是跑过现成训练脚本。


如...