Token Foundry-Reward System算法工程师-Qwen
岗位描述:负责 Qwen 基座模型 Agentic Reward System 的设计、训练与迭代,构建支撑大规模 Agentic RL 训练的奖励信号体系,持续提升模型在 Coding、Agent 等高价值场景下的对齐质量与 RL 训练上限。 1. Coding Reward System:构建面向 Cod;任职要求:1. 计算机、人工智能等相关专业硕士及以上学历, 具备相关领域的顶会论文发表优先。 2. 扎实的工程能力,有工业界大语言模型SFT / RL 训练经验的优先(熟悉 PPO / GRPO 等完整流程)。 3. 对 Reward System 有独立的技术判断,能
