10000元以上
多模态大模型算法工程师 (VLM方向)
北京人形机器人创新中心有限公司发布时间:2026-09-02浏览量:136
职位描述
1、负责机器人多模态包括但不限于视觉,语音,触觉,文字等各种模态输入的模型开发和研究工作; 2、跟踪国内外多模态与机器人相关的最新研究进展,能够快速理解并评价相关研究,并能够提出创新性观点,写作论文并推动相关研究发展; 3、与团队配合完成数据集的收集,整理与清洗,设计和改进模型架构,独立完成模型优化和参数整定,并训练模型; 4、与团队配合在云或端完成算法的部署,并与实际机器人交互实现自主化作业能力。
职位要求
1、教育背景:计算机科学,人工智能,电子工程,自动化或相关领域的硕士或博士研究生学历优先; 2、多模态算法核心能力: - 在多模态学习领域有深入的研究和扎实的理论基础,对图像/视频理解与自然语言处理(NLP)的交叉领域有深刻见解; - 精通至少一个或多个前沿多模态研究方向,例如:视觉问答(VQA),视频字幕/摘要,视觉语言导航(VLN),多模态知识推理,扩散模型(Diffusion Models)在多模态内容生成与理解中的应用等; - 有在高水平会议或期刊上发表相关论文者优先; 3、深度学习与框架要求: - 具备深厚的深度学习理论基础,精通PyTorch等至少一种主流深度学习框架; - 熟悉并有实际使用经验,例如:Transformers, ViT, CLIP, BLIP, Flamingo等主流的多模态模型架构; - 有大规模模型训练、微调(Fine-tuning)和推理优化经验(如LoRA, PEFT, vLLM)者将是重要的加分项; 4、编程与工程能力:具备卓越的Python编程能力和良好的代码规范,能够高效地实现和验证算法原型。 加分项: 1.有视频理解(Video Understanding)领域的深入研究经验; 2.对3D视觉,NeRF,SLAM等技术有了解或实践经验; 3.有参加过国际性的学术竞赛(如VQA Challenge, ActivityNet Challenge等)并取得优异成绩者; 4.对具身智能领域有浓厚兴趣,并对未来的技术发展方向有自己的思考和见解。
企业其他招聘信息
结构工程师
2026-09-02
多模态大模型算法工程师(世界模型方向)
2026-09-02
AI Agent 算法工程师
2026-09-02
具身操作算法工程师
2026-09-02
具身智能算法工程师
2026-09-02
导航-感知算法工程师
2026-09-02