电话:023-67573061
关闭
强化学习算法工程师 7000以上 收藏 投递简历
您当前的位置: 首页 > 职位列表 > 职位详情

强化学习算法工程师

7000以上
重庆-重庆 | 应届毕业生经验 | 硕士学历 | 可接受应届生
面议
被浏览:
小程序
微信小程序
↑微信扫上方二维码↑
即可在微信小程序内查看并分享
分享
微信扫一扫:分享
↑微信扫上方二维码↑
便可将本文分享至朋友圈
联系方式
向经理
企业未开启查看联系方式,请直接投递简历 投递简历
职位描述
需求专业:计算机软件 招聘人数:4 到岗时间:不限 年龄要求:不限 性别要求:不限 婚况要求:不限
岗位定位: 本岗位属于大模型后训练与对齐方向,核心聚焦利用强化学习(RL)技术对金融垂类大模型进行行为优化与价值观对齐。你将负责从奖励模型构建到强化学习训练的全链路研发,致力于让大模型在金融高敏场景中更可靠、更安全、更可控。 岗位职责: 负责金融大模型的强化对齐(RLHF/RLAIF) 研发,包括奖励模型(Reward Model)的设计与训练、策略优化算法(如PPO、GRPO)的调优与落地,提升模型的有用性、安全性和金融专业能力。 针对金融对话与决策场景,构建基于强化学习的策略优化框架,优化模型在多轮对话中的意图识别、任务完成率及逻辑连贯性。 研究并应用前沿对齐技术(如DPO、IPO、Constitutional AI等),探索高效、轻量的偏好优化方案,降低训练成本,提升迭代效率。 设计并迭代奖励信号与评估体系,结合人工反馈与自动评估指标,构建可量化的模型行为评估闭环,驱动模型持续进化。 跟进强化学习与大模型对齐领域的前沿学术进展,探索可扩展的监督方法,推动技术创新在金融场景中的落地。 任职要求: 学历专业: 硕士及以上学历,计算机科学、人工智能、自动化、数学等相关专业。 理论基础: 深入理解强化学习核心算法(如PPO、DQN、策略梯度方法),熟悉大语言模型的后训练范式(SFT、RLHF、DPO等)。 编程能力: 熟练掌握Python,精通PyTorch框架,具备良好的工程实践能力,能独立完成模型训练与调优。 实践经验: 有大模型微调或强化学习训练的实际项目经验(含实验室项目或实习经历),熟悉至少一种RL训练框架(如DeepSpeed Chat、TRL、OpenRLHF等)。 加分项: 在NeurIPS、ICML、AAAI等顶会发表过强化学习或大模型相关论文;有奖励模型设计、偏好数据构建或线上策略优化经验;对金融场景有理解或兴趣。
求职提醒:求职过程请勿缴纳费用,谨防诈骗!若信息不实请举报。
该公司的其他职位
  • 会计/金融/银行/保险
  • 股份制企业
  • 1000人以上

马上消费金融股份有限公司(简称 马上消费 )是一家经原中国银保监会批准,持有消费金融牌照的科技驱动型金融机构。公司于2015年6月正式开业,于2016、2017、2018年分别完成三次增资扩股,注册资本金达40亿元。股东包括重庆百货、中科金、物美集团、重庆银行、阳光财险、浙江小商品城,以及新一轮战略投资者中金公司、中信建投及重庆两江产业集团等央企与地方国资背景资本。

竞争力分析
综合竞争力评估
问公司
对职位有疑问?快来问问吧
手机扫一扫
随时随地找工作
职位收藏成功
您可以在职位收藏夹中查看
您正在申请 强化学习算法工程师 职位,请选择您要投递的简历
申请成功
恭喜您职位申请成功,请耐心等待企业回复
您可能感兴趣的职位:
投递者简历要求(* 你的简历需必填红色项目才能领取红包)
工作经历
不限
教育经历
不限
项目经历
不限
技能证书
不限
赏金投递
完善简历
关注微信公众号
申请结果早知道
联系时请说明是在两江新区人才网上看到的
向经理
191****0128
正在获取二维码...
请使用微信扫一扫
客服服务热线
023-67573061
微信公众号
微信小程序

Copyright C 2020-2021 All Rights Reserved 版权所有 重庆两江新区人才发展集团有限公司  渝ICP备2021001278号-3 渝公网安备 50011202503459号

地址:重庆市渝北区龙兴镇田家湾(北京理工大学重庆创新中心22号楼) EMAIL:cqljhrzp@163.com

人力资源证: (渝)人服证字〔2017〕第3900000212号

Powered by 两江新区人才网

用微信扫一扫