在AI研究热潮中保持理智的可行建议。

我已经阅读了数十篇机器学习论文,并开始掌握如何学习论文的方法。首先,要了解阅读特定论文的目标!我发现有大约3个主要原因,每个原因都涉及略有不同的技巧,这是研究的同等重要部分。
与热点保持最新
在我们深入研究论文之前,我们先来看看阅读论文的第一个原因。与最新突破和热点保持最新。在这里,您需要最高水平的理解。
即使您是一名计算机视觉研究员,您也应该了解大型语言模型的最新发展。我并不是想加剧您的“FOMO”,但我认为能够与其他研究人员进行有意义的闲聊是很重要的,或者最理想的情况是能够幸运地学到一个新技术,可以应用到您自己的研究中。
现在,在您开始浏览新论文之前,您首先需要了解最新和最热的出版物是什么。因此,我建议简单地关注Twitter上的大型AI实验室,如X,以及LinkedIn,还有一些AI新闻人物,如Lior S.或Aleksa Gordić。通常,当人们发布论文时,他们会对主要贡献和结果进行摘要。然而,如果您想自己阅读论文,您应该从摘要开始,以了解论文的主题。摘要是作者自己对论文进行的最简洁总结。它通常已经包含了他们的主要结果,“我们比其他模型更好和/或更高效”。但是,看到它到底有多好,以及它的主要优势可能是很酷的。如果摘要没有突出论文的主要贡献,您可能需要在引言中寻找它们,或者使用AI来学习AI!当然,已经有可以帮助您阅读论文的LLM工具。例如,您可以直接询问像SciSpace Copilot这样的完全免费工具,以摘要论文或列出主要贡献,这通常非常有效!
记住,我们需要知道“阅读”论文的目标是什么。在这种情况下,我们只是希望对正在发生的事情有一个高层次的理解。所以,确实,Twitter、LinkedIn和(稍微滞后的更新)YouTube上的AI新闻人物非常好!
探索自己研究的思路
再次,在我们讨论您可能最想听到的原因之前,我们简要谈谈阅读论文的第二个原因:为自己的研究探索思路。
有哪些新技术、数据集或更高效的实现可能对您来说很有趣?仅在2022年,就有大约1000篇论文被ICLR接受。您不可能彻底阅读所有这些论文。除了热点论文,您可能还想查看研究领域的新思路和见解。而如果真的仔细分析,许多论文都提出了一个核心新思路,通常非常简单。

例如,如果您正在研究语言模型,对比解码[1]的基本思想实际上只是说“让一个强大的和一个较弱的语言模型生成下一个标记的输出逻辑,然后逐元素相减以得到新的输出逻辑。这将产生更多样化的结果。”
这个过程可能需要很多探索。主要是通过简单地在Google上搜索论文,浏览会议的出版物列表,或者更自然地,通过递归地查看您已经阅读的论文中的引用来进行探索。最终,我们再次想要阅读摘要,希望找到主要思想及其性能改进,即主要结果,始终记住:这如何帮助我进行研究?但由于我们已经进入2023年及以后,如果您一时无法理解主要思想,您可以再次向AI工具询问提取主要贡献、新颖性和结果,并让它用简单的术语解释概念。事实上,在某些情况下,我们还可以直接要求比较新方法与另一种方法!另一个要看的是架构图,如果有的话。这通常能让您一目了然地了解模型或流程的概述。
将其融入您自己的研究 – 深入探讨
如果您现在觉得这篇论文的主要思想和结果非常适合您自己的研究,那么我们终于来到了阅读论文的最后一个原因。真正深入细节,以潜在地将其融入您自己的研究并在其基础上构建。
坦率地说,如果有关于这篇论文的视频或博客文章,那就是一个宝贝!在我看来,最好是先看YouTube视频或博客文章,然后再阅读论文。这样,您就知道可以期望什么,应该最关注什么,并且已经有了基本的理解。论文的术语非常复杂和(可以争论的)不必要的艰深。
现在,我们应该看看论文。特别是如果没有视频或博客文章,您需要(如果还没有)从摘要开始,然后再看结果。如果您想在此基础上进行扩展,了解他们用于训练和评估的数据集可能非常有用。如果可用,您可能想要自己使用这些数据集!
现在来看看方法部分。为了真正理解模型,我建议您先看模型图。正如提到的那样,这将给您对数据流的感觉。然后,开始阅读解释该模型的文本。从基本层面上来说,过于简化,深度学习模型只是对某些矩阵或张量进行一系列重塑操作。因此,如果您查看模型的各个块,将会有一个具有特定形状的输入和一个具有相应形状的输出。在文本中,可能会有一些数学来规范这种转换。
我无法再强调这一点了。 您需要始终了解数据维度,即其形状如何变化。
我喜欢做的是在每个操作之后以及最后一个块之后写下形状。如果我逐步进行这个步骤,它不会像最后看起来那么令人难以承受,并且对我非常有帮助!
这里有一个专业提示。如果存在与论文有关的代码:下载它并在VSCode的调试器中逐步进行。这意味着查看论文中引用的作者自己的实现,查看具有代码的论文的第三方实现,或者在我看来更容易的是导入并运行Hugging Face模型并逐步进行调试。您要寻找的是将代码操作或模块与论文中的模型图和数学公式进行匹配。而且,始终查看并了解输入和输出的维度。
现在,当涉及到数学公式时,它们通常看起来很可怕,但意思很简单!特别是当您看损失函数时。作者经常会使用常见的损失函数,如负对数似然、交叉熵、均方差等。但即使他们制定了完全新的损失函数,它只是一个人类思想的数学表达。
![如何在2023年阅读机器学习论文(初学者版) 四海 第3张-四海吧 GAN Loss, [2]](https://miro.medium.com/v2/resize:fit:640/format:webp/1*0hHCG07GedZqOdXhcIJ2aw.png)
例如,训练鉴别器以将真实图像识别为真实图像,将生成图像识别为伪造图像。然后,训练生成器生成使鉴别器认为它们是真实图像的图像。然后重复这个过程。您可以再次使用人工智能来帮助您解释这些公式!我们真的生活在令人着迷的时代!
使用这些不同的技术、人工智能工具、VSCode调试、仅仅观看论文解释视频或博客文章、查看数据形状或分析损失,无论您遇到不理解的内容还是您有一个“啊哈!”时刻,您都应该始终进行高亮并做笔记。
当然,有些论文非常困难,非常理论化或数学密集,或者是涉及许多领域知识的人工智能和科学交叉领域的论文。最终,真正理解一篇论文的解决方案始终是相同的。坚持下去。如果在阅读论文时不理解一个思想,不要担心。继续阅读,它可能会变得更清晰。如果您当前阅读的论文没有为所引用的技术提供足够的解释,请查看它们所引用的论文并阅读。我喜欢的另一个专业提示是想象研究人员在简单的咖啡休息时如何谈论他们的想法。
我知道…可能有点烦人,但我保证,开始总是最难的。你在开始阶段努力积累的这些知识,将有助于你在未来更轻松地阅读新的论文!再次,我保证!
可操作建议摘要
所以,简要总结可操作建议:
- 我通常都是先阅读摘要,然后是结果,最后是方法论部分。
- 使用其他来源,如YouTube或博客。论文术语通常非常简洁,因此经常很难理解。
- 如果有代码:使用调试器逐步执行代码,并始终理解输入和输出的形状。
- 最后,不要犹豫使用像SciSpace Copilot这样的人工智能工具,帮助你总结和提取主要贡献,简化语言,并解释一些数学公式。
我将会发布更多这样的论文解读博文(还有YouTube视频!)。我希望我的总结和解释能够让你更容易跟上人工智能领域的进展,如果你不想错过未来的博文,请不要忘记关注!
P.S.:如果你喜欢这个内容和视觉效果,你还可以看看我的YouTube频道,那里有类似的内容,但有更多精美的动画!
参考文献
[1] 对比解码, X. L. Li et. al, 2023, https://arxiv.org/abs/2210.15097
[2] 生成对抗网络, I. J. Goodfellow et. al, 2014, https://arxiv.org/abs/1406.2661