一位西交人工智能实验班 rank 4/64 的本科生分享了自己从大一锁定目标实验室、历经两段科研转向最终上岸的保研历程。作者以 CVPR 共一和 ECCV 一作为基础,大二暑假进入上海人工智能实验室实习并锁定 offer,随后通过夏令营流程获得上海交大计算机优营。内容涵盖 RoboMaster 竞赛经历、医学影像分割论文投稿复盘、跨方向跳槽决策,以及机试准备与面试经验。
🔴 起点:RM 与口罩时期
我高中因为所谓素质教育,接触了 RoboMaster,用 DJI 的 S1 套组写图形化程序打水弹对抗,技术沉淀为零,但记住了这个比赛。大一提前学完高数线代,百无聊赖,找到了学校的 RM 队伍。
口罩时期不用线下上课,我就在实验室写程序、听课。回过神来的时候,和舍友已经算不上熟络了。前前任视觉组组长 WJH 学长帮我打破了信息差:知道了绿群,开始了保研路;也知道了科研是怎么回事,从广泛学 ML 和传统 CV 转向聚焦领域。
🟡 第一段科研:医学影像的沉没成本
本校算力是混用的四卡 2080Ti 和 3090,我找周老师是因为看到他 scholar 有 inpainting 论文。结果他实际做多目标检测和医学影像,让我看半监督医学分割的论文。
当天复现完,自己改了改,开了若干次组会,忽然有个 idea,就有了 PMT: Progressive Mean Teacher via Exploring Temporal Consistency for Semi-Supervised Medical Image Segmentation。验证 work 之后赶 CVPR 2024,粗心失误太多,被拒。转投 ECCV 2024,443 初分,rebuttal 后 554,meta reviewer 不太喜欢,但中稿了。
同期还在做另一个 meta learning 的工作,投完 ICLR 2025 就不再继续。
在医学影像里摸爬滚打一年,我决定跳出舒适区。半监督医学影像某种程度上是伪命题:用五张 labelled data 超过八十张的效果,这和 leverage 大量 unlabelled data 的半监督思想相左。还有更哭笑不得的:单纯换 K-fold 性能掉 10 个点,hack 层出不穷。
🔵 转向具身:SHAILAB 的"白月光"
二择:MLLM 还是 Embodied AI。因为早年机器人探索,选了后者,去了大一 WJH 学长提过的 SHAILAB。当时印象极深:实习工资一天三百,单人间多人套间公寓。现在看待遇已不是最具竞争力,但好歹算白月光。
带着 ECCV 申了具身智能中心(当时还叫 OpenRobotLab),和庞江淼老师套瓷,两轮聊天式面试,进了伦哥组。大二暑假线下实习,之后转线上。大概这时候起,offer 基本锁定了。
我其实没有什么波澜壮阔的面试经历,就是恰当的时候,运气推波助澜,获得了稳定的 offer。
🟢 保研流程:AILAB 夏令营 + SJTU CS
AILAB 夏令营期间被 hr(还是 ur?)提醒报名,线下笔试面试。唯一一次和绿群群 u 面基,吃了海底捞,上海麻酱一股怪味,糟糕。当晚请教机试心得,得到 代码随想录刷题列表,着重学了 dp,定了 Python 放弃卡时长题目 的策略,最后 AK。
SJTU CS 夏令营更没悬念,面试就是聊天,听说入营即优营。
🔴 科研的焦虑:GenManip 与数据生成
在 SHAILAB 第一段阶段性产出是 GenManip,投 CVPR 2025,5442 遗憾 poster,rebuttal 漏掉问题导致 3 分审稿人降分。
初衷很明确:看到 CoPA、MOKA 等模块化方法,判断端到端通用操作智能短期内不现实,分层架构 + 双系统可能是趋势,于是在仿真中做 Benchmark。用 Isaac Sim 搭建,根据 scene graph 验证成功或生成 layout 的算法很 naive 但有效。
之后我投身数据生成。短期看具身数据贫瘠是重大缺口,仿真成本低、变量可控;长期看 scaling law 下,走通数据-模型-实验闭环是必须的。
GenManip 后续迭代聚焦 skill set 方式实现泛化数据生成,内部迭代后最近要完全开源。基于它产出了 InternData-M1(大规模 scaling up pick-and-place 数据集),Evaluation 部分 contribute 给 InternManip(all in one manipulation 训测工具链),十个双臂任务作为 IROS Workshop Manipulation 赛道赛题。
内部迭代支持定制化 Layout 设计到 Object Scaling,三分钟完成数据生成任务设计,之后支持 Articulation object general scaling。年初就有雏形,但论文 ArticuBot 被撞车,失去紧迫感,一拖再拖。
🟡 长期主义的悖论
过去一年做仿真和数据生成,上半年没多少论文产出,但只要做的事必要,就会被需要。读者可以在实验室近期成果里看到我,比如 InternVLA-M1 技术报告。
但仿真有极限。pick-and-place 和 1-dof articulation 我确信有通用算法,但软体、流体操作 general 成本越来越大,corner case 越来越多。资本入局,数据工厂建立,单任务 hardcode 降低技术栈要求,这正在成为不可阻挡的未来。
似乎是时候带理解去模型领域了。但比起中稿,更困扰我的是:这条路线是否值得下一个一年?像上一个一年一样,回头去看依然必要、依然有价值?
这个问题留给同样 junior 的读者:你现在做的事是否值得你的一年,而不是一个审稿周期?放眼整个博士生涯,这件事又该是什么?
⚠️ 一些反思
上方是 AI 整理的精读版。原作者亲笔写的完整经验贴 (含更多细节、原始语气、问答互动)仅对会员开放。 升级后即可解锁全站全部经验贴,不限次数阅读。