提示:国家大学生就业服务平台提醒您注意甄别违法、虚假、高风险招聘信息,警惕索要隐私信息的行为。在投递简历前务必提前确认企业资质与职位真实性,若遇到诈骗、泄露个人隐私等情况,请向我们投诉举报。
- 算法
- [全职]
- ——
- 算法
- 收藏
- 举报
- 6k-11k
- |
- 本科及以上
- |
- 招聘 2人
- 09-05 12:00 更新
计算机科学与技术,软件工程,网络工程,数字媒体技术,信息安全,物联网工程,智能科学与技术,空间信息与数字技术,电子与计算机工程,数据科学与大数据技术
来源:
成都艺术职业大学
WhGNVNCE8UBGgVtSf5ZFWn
-
四川省成都市
职位详情
岗位职责
1. Benchmark调研与复现
调研并复现大模型 Agent、工具调用、代码执行、终端操作、RL Environment 等方向的前沿 Benchmark,如 Terminal-Bench、SWE-Bench、Toolathlon、GAIA、WebArena、OSWorld、AgentBench 等;重点深入研究Benchmark 的任务设计、环境交互、评测指标与自动判分机制。
2. 评测 Pipeline 搭建
参考 Terminal-Bench / SWE-Bench 等范式,搭建完整自动化评测流程,包括任务加载、环境初始化、模型调用、交互执行、日志记录、自动判分与结果分析,支持主流大模型 / Agent 接入。
3. RL Environment / Agent Environment 构建
参与设计终端、代码仓库、工具调用、网页/软件操作等交互式环境,构建可用于模型评测、RL 训练或数据生成的任务环境,设计 reward、verifier、success criteria 等评测机制。
4. 新 Benchmark 探索
基于现有 Benchmark 的不足,参与设计新的任务、数据集、评测指标和 baseline,探索构建新的 Benchmark / Environment,并沉淀技术文档与实验报告。
5. 评测分析与优化
分析模型在 Benchmark 上的表现,定位失败模式、能力短板和环境问题,为模型训练、数据构造和 Agent 框架优化提供反馈。
看了该职位的人还会看 更多