‹ 返回列表
AI 重要度 8.3

前字节、腾讯AI核心研发孙鹏加入星尘智能,负责机器人强化学习后训练|最前线

重点提炼

作者|黄楠 编辑|袁斯来 36氪获悉,9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中⼼负责⼈孙鹏博⼠正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。

作者|黄楠

编辑|袁斯来

36氪获悉,9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中⼼负责⼈孙鹏博⼠正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。

孙鹏博士毕业于清华大学,此后先后在康奈尔大学和罗格斯大学从事博士后研究。他长期专注强化学习(RL)、智能体(Agent)及多智能体强化学习(MARL)研究,拥有横跨机器人强化学习、大规模分布式RL系统与大模型强化学习的研究与产业实践经历,兼具算法研究与系统工程的技术积累。

早前在腾讯 AI Lab 及 Robotics X 机器人实验室期间,孙鹏曾担任智能体中心负责人,开展深度强化学习与机器人控制研究。他曾利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随;同时研发《星际争霸》AI智能体TStarBots、TStarBotX,在多智能体强化学习(MARL)复杂博弈环境研究中取得重要成果。

加入字节跳动后,孙鹏将其技术实践由算法全面拓展至大规模RL系统工程。他主导开发了核心强化学习基础设施 ByteRL,支撑多款自研游戏AI高效训练。其团队曾夺得IEEE CoG 2