大模型与视觉任务的通用创新范式
从微观的技术来看当下的模型在CNN和Transformer架构下实际上网络的创新已经停滞了,通过更大的参数量和数据集换来更优秀的效果和落地其实更多的是对任务的设计和拓展,而通过在一个成熟的baseline里塞attention或者简单的改造即使涨点了我们也难以将它变成从工程代码变成一个学术研究论文。
因此作为一个科研人, 我们要从宏观网络的架构思考为什么同样的技术可以在不同的方向里持续产生论文,一个好的idea对应的是应该是故事而不是代码。这也就是为什么有些工作可以拼接中顶会,为什么有些论文不训练也可以中稿,如果这样的思路拿到我们自己的任务中那必定是一个很高级别的创新。因为我们的目标是学着成为产出这样创新方式的人群。
本课程在设计时主要希望以更宏观且新颖的角度理解深度学习所谓的“贡献”和任务之间的关系,一门课理清视觉任务之间的爱恨情仇和贡献,而上述问题的答案和套路也将在本课程中去传递给同学们。
同时在课程的论文安排上,除了经典论文,会最大化引入近期顶会中的论文以及Arxiv放出来的相关论文,以最新的论文内容讲解创新点的产生,以及论文的书写范式,确保每期课程和每个同学的idea都紧跟前沿。
