作为一家创新科技公司,字节跳动对前沿探索有着长期投入的决心,也非常重视优秀技术人才的招募和成长。
去年,字节跳动发起“筋斗云人才计划”。今年,“筋斗云人才计划”迎来升级——毕业年限放宽,课题数量增多,希望在全球范围招募更多顶尖技术博士,“一起为世界折腾点东西出来”。
“筋斗云”的发起,并非字节技术同学们挑战技术前沿的起点。此前,我们在《顶尖博士在字节跳动实习的 1600 天》和《当一群技术博士决定“折腾”出点什么》中,曾刻画过他们的故事。
这次,我们又邀请到了部分筋斗云课题的“新/老同学”,聊了聊一个课题的“前世今生”,以及身处不同阶段的同学们,是怎样做事的:
一次技术革新到来之前,
信号会迅速传导至每个技术人身上。
影响未来的分水岭或许在此刻就已出现:
有些人跃跃欲试,但有些人已经上手干了。
2023 年,我加入字节跳动不久后,就赶上了由 ChatGPT 引发的大模型热潮。
我第一个接触的场景是对“可观测时序指标检测结果的解释”:当系统发出时序指标异常告警时,用户往往难以理解背后的确切含义。因为准确的解释需要结合指标自身定义、异常形态和业务逻辑等因素,难以用统一的规则覆盖所有场景,传统技术方法也在此遭遇了瓶颈。
大模型的出现带来了转机,我意识到,它的语义理解能力可以建立起指标告警与指标含义间的桥梁。尽管对大模型还比较陌生,但我还是尝试做了个 Demo,验证了它在解释异常告警上的可行性。
这个 Demo 在团队内引起了讨论,大家都认为这项技术拥有广阔的想象空间。后来,部门内开始陆续组织大模型技术研讨会,并邀请内外部专家分享交流。在深入学习理解底层原理后,我们也开始思考:能不能把大模型技术用到更广泛的场景,做一些颠覆过往的创新?
紧接着,我们开展了 AI for Infra 的一系列探索。例如,利用大模型技术构建故障诊断的 Workflow(工作流),通过将复杂排障流程拆解到 Workflow 上,让大模型直接在一些 SOP(标准作业程序)的关键节点做出诊断。目前,我们正在尝试利用大模型技术实现自动化 Oncall(线上工单)升级,主动识别紧急的、报告严重问题的 Oncall,并及时将其升级给产研/稳定性/故障应急等团队。
就这样,我们从最开始一个 Demo 出发,一步步将想法付诸实践,探索的道路越走越远,最后成为了团队筋斗云课题的重要方向之一。
在谷歌提出“Wide & Deep 模型”的七八年后,我们看到了推荐系统的技术拐点已经到来,引领行业下个五年新范式的机会就在眼前。
如果把时间拨回到一年前,我可能还不敢做出这样的判断。但从 2023 年大模型技术兴起到今天,结合我们具体的业务实践来看,推荐模型结构的演变方向已经明朗——超大规模推荐模型。
向外看,有天时:LLM 大模型无论是从框架创新,还是在场景通用性和泛化能力上,都为我们提供了很丰富的经验。同时 GPU 产业链的成熟,也为模型发展提供了大算力保障。作为机器学习在工业界落地的主要场景之一,推荐系统的再次爆发成为大势所趋。
向内看,有地利:我们对接的公司内部业务中,随着线上模型参数越来越大、结构越来越复杂,为业务带来的增益也越来越明显。在实践层面,这验证了技术演进的正确性。同时,面对技术拐点,公司近几年也一直在鼓励我们去“冒险”,积极尝试一些短期 ROI 看起来可能不那么高的事,并提供了丰富的资源支持。
事实上,除了字节,其他企业也在尝试类似的方向。我认为未来的一年到一年半非常重要,谁能抢占先机,关键在于“人才”。
我认为筋斗云课题组的同学们就像是一支“探路队”,需要在开矿之前将蓝图摸索清楚。我经常鼓励他们,坚信选择的方向,要敢想敢干,创新一定面临风险,失败并不可怕,总结教训后继续出发。
如果把一个筋斗云课题看作一颗种子,
随着它的生根、破土、开花、结果。
课题背后的技术同学们,
也在经历着不同阶段的成长。
今年 3 月,我通过字节筋斗云实习面试,成了组内的第一个实习生。
此前我一直聚焦在网络领域,没怎么接触过跟模型相关的东西,更遑论垂类的推荐大模型的优化了。刚来的时候,真的是两眼一抹黑。Mentor 知道这种情况,跟我约了几次一对一沟通,并嘱咐我提前把想要了解的问题整理出来。
现在回想起来,真的很感谢我 Mentor。我是个非常爱“较真”的人,每一件事、每一个点都想搞明白,所以我们每次一对一沟通都要持续两个小时左右。有时是下班后开始聊,聊完后天都已经黑透了。也正是这几次关键的沟通,解答了我很多困惑,也帮我建立了系统性认知。
不只是刚来那段时间,我刚说自己爱“较真”,鬼点子非常多,等逐渐上手后,我恨不得在一件事上提 10 个想法。这时跟 Leader 和 Mentor 沟通时,他们会事无巨细的帮我解答,告诉我哪些方向目前值得花精力做,哪些可能是弯路或者是下一阶段要做的。除了 Leader 和 Mentor,其他同学也在自己擅长的领域给我提了很多建议。
在这里实习,我感受到最深的另一点是能接触到最前沿的东西,也有资源、时间和空间去实现自己的想法。前段时间跟 Leader 讨论 Q3 的 OKR,里面的想法都是我自己摸索出来的,也是部门没人提过的。Leader 很开心,鼓励我一定要做下去。
今年 3 月加入公司后,部门负责人跟我聊过一次,明确了我在筋斗云课题里的定位——在探索技术前沿的同时,将大模型的世界知识应用到搜索的精排效率提升上。
应该说,部门内的氛围和学校实验室很像,但在工作方式上有着很大的差别。之前在学校做技术研究和实验,通常采用的都是公开数据集,比较干净。在实际业务中遇到的数据却更加复杂,做实验时也涉及到真实的用户测试,这就导致实验流程配置的复杂化,需要注意的“坑”也更多。
比如我刚来实习时接手的第一个项目,是采用强化学习的方式训练 LLM,来预测用户搜索商品的相关性。凭借在学校做实验积累的经验,从学术角度我个人认为这是个很好解决的事。
但到了做线上 AB 实验时,我忽略了“开流量”阶段要设置一个平滑过渡,模型刚一上线就引发了架构同学的报警提醒。我当时心里很慌,赶忙求助组内的其他同事,他相当于帮我重开了实验。
后来,其他同学会把自己过去“踩坑”的经验梳理成的文档分享给我。在他们的“引路”下,类似的“坑”着实避免了不少。随着我的思路转变和对工作的熟悉,我的第一个项目顺利上线,节省了模型资源消耗、提升了模型性能,同时也过滤掉了噪声,让用户有了更好的搜索体验。
一家公司越来越大,新人还有从 0 到 1 的机会吗?我想在字节跳动,这个答案是肯定的。
我去年 6 月博士毕业,7 月正式加入公司,现在是部门筋斗云课题组的“2 号员工”。我们在做非常前沿的研究,很多事都要从 0 到 1 开展,这也给了我一个从顶层设计到具体实践都能尝试的机会——这种感觉非常爽。
一个筋斗云课题的推动需要整个部门共同努力,虽然我们有明确分工,但每个人都能参与到不同领域探索中去。拿我来说,我重点做 Deep Research 的研究和业务落地,无论是基础设施建设、模型训练、推理还是外部开源工具的适配等全链路都会看。
这就是我在这里感觉到另一个很爽的点,不设边界,只要你的想法被认可,就可以带领大家迅速开展。大家的动作也非常敏捷,这里没有冗长复杂的流程,很有可能今天只是个想法,明天就已经推动落实,很快就拿到初步成果了。
还记得之前我们做一个搜索模块的优化,参考了业界一些开源的工作。明确方向后,我们很快就搭建起了训练框架并且搞定了开源工具的适配,在随后的开展阶段也小步快跑地不停试错、修改、迭代。不到一个月,我们就取得了超过预期的成果,在公开数据集上也拿到了比最开始参考的开源模型更高的测试分数。
当然,在技术探索的路上并非全都是成功,
每个技术人都曾经历过失败与挫折。
因为 Leader 的一句话“你来了之后,不给你设方向限制”,我选择加入了字节跳动。
在当时还比较小众的汽水音乐,我们开发了行业首个“兴趣时钟”算法,为业务带来了不错的收益。其实,兴趣时钟的研发过程并没有什么动人心魄的故事,无非就是遇到一个又一个小问题,一次又一次解决它们,直到最后走向成果落地。
如今,在筋斗云课题“推荐领域的大模型探索”中,我正在和其他同学一起,探索有别于以往技术链路的推荐大模型新范式。作为很多新同学的 Mentor,我也经常鼓励他们所有方向都可以尝试,只要想法合理,大胆去干就行了。不要害怕犯错,专心做技术,真错了有我顶着呢。
其实,我认为技术创新的路上并不存在弯路,对和错是从结果倒推出来的。在新范式探索时,所有人都没有掌握明确的方向,一条路走不通就换另一条,即便努力后没有取得成果也值得肯定,收获的经验对团队来说也是一笔宝贵的财富。
几年前博士毕业时,我放弃了留校任教的机会,选择了来到字节跳动,因为在这里能利用前沿技术做一些更落地的事。
我觉得个人成长和模型训练很像,都需要不停获得正向奖励,才能清晰地知道自己在做的事有价值。过去几年,我可以依靠公司和部门非常完善的配套设施,采用各种最前沿的方式进行技术优化、迭代,并在丰富的场景实现落地,当我开发的某个算法功能上线,在社交媒体上被用户称赞时,那种成就感非常强。
但在成就感之外,技术探索的不确定性,也会给人带来沮丧和失落。还记得在 AIGC 大模型刚兴起时,我们第一时间就基于扩散模型做出了一版超分系统,但在内部评测时,并没有取得很好的效果。原因是我们并没有太多模型调试经验,当时公开的论文也主要聚焦在图像编辑和生成领域,很难直接参考。
没办法,只能从 0 开始,一切都摸索着来。记得当时经常会面对大量待调试的参数组合,为了提高效率,我们会先凭借对超分的调试经验控缩到重点范围内,然后再做遍历性实验。运气好,做三五十次,运气不好,就需要全都尝试一遍。现在已经很难回忆起那段时间是怎么挺过去的了,基本每天都在失败、再战,屡败、屡战中循环往复……最后尝试把所有细节融合在一起,才最终走向成功。
在此期间,团队 Leader 对我们很有耐心,不会因为几次失败就怎么样,相反会一直鼓励我们多尝试,并且做好资源层面的各种支持。
左:原图 右:图片超分后的效果
今年 5 月实习,6 月博士毕业后正式入职,虽然加入不久,团队却给了我很大的信任。
实习的那一个月,我结合部门成果和自己过去的经验,与部门原有的方法论做了融合,并在细节推动上起到了重要作用。正式入职前,我分别以共同一作和二作的身份,在顶会 NeurIPS 上投稿了两篇论文。
读博期间合作的一些期刊编辑以及关注我研究进展的读者看到了这两篇文章,都祝贺我加入字节这样一家充满创造力、计算资源丰富的公司,并为我能在短时间参与到有影响力的成果研究中而感到开心。
除了团队的信任,我在这里也得到了部门同学们不遗余力的帮助。记得我接手的第一个项目“Omni-MLLMs”就很关键——在模型原有视觉和文本模态基础上,合理的推演音频模态建模策略,构造全模态的 Tokenizer 能力。
这对一个尚未充分熟悉模型基建的新人来说很有挑战,于是我找到了之前负责基建的那位同学,他把每个细节都掰碎了跟我讲,甚至会用笔在纸上把每个关键细节画出来。在他的帮助下,原本需要一周才能掌握的东西,两三天就搞定了。
目前,我正和 Mentor 共同负责从 0 到 1 推动推荐大模型的建设和应用。在研究探索的路上,哪怕能为技术发展带来一丁点贡献,都足以让每一个技术同学心潮澎湃了。
点击阅读原文,一键投递“筋斗云人才计划”
本文来自作者[Hedy薇薇123霓22]投稿,不代表教育门户网立场,如若转载,请注明出处:https://www.dtedu.com.cn/gkzx/202609/1130470.html
评论列表(4条)
我是教育门户网的签约作者“Hedy薇薇123霓22”!
希望本篇文章《一个筋斗云课题是怎样「炼」成的?》能对你有所帮助!
本站[教育门户网]内容主要涵盖:教育咨询,知识百科
本文概览:作为一家创新科技公司,字节跳动对前沿探索有着长期投入的决心,也非常重视优秀技术人才的招募和成长。去年,字节跳动发起“筋斗云人才计划”。今年,“筋斗云人才计划”迎来升级——毕业年限放宽,课题数量增多,希望在全球范围招募更多顶尖技术博士,“一起