Token Foundry-RL算法专家-Qwen
岗位描述:强化学习(RL)是 Qwen 系列基础模型持续演进的重要技术方向,被广泛应用于提升模型在复杂任务中的推理、规划、编码、工具调用与长程决策能力。我们持续探索 RL 在长程代码任务、视觉交互、真实环境执行、数学与代码竞赛等场景中的应用,推动模型在复杂开放任务中的自主性与执行表现。欢迎对大模型与强化学习方;任职要求:1. 计算机、人工智能、自动化等相关专业本科及以上学历,硕士/博士优先。 2. 在强化学习(RL)与 Agent 方向具备扎实基础与实际经验,深入理解 PPO、GRPO 等主流 RL 算法及训练方法;有大模型 RL、Agent、代码生成、Reward Mode
