禅与 AI 研究的艺术

@jxmnop
АНГЛИЙСКИЙ1 месяц назад · 15 июн. 2026 г.
185K
691
78
16
1.2K

Суть

深入探讨 AI 研究所需的性情与习惯,强调基础知识的重要性、实验中的怀疑精神,以及在远离键盘时获得“顿悟时刻”的价值。

所以你想做 AI 研究?确实,从来没有人 真正 教过你怎么做。至少不是直接教。但事实证明,入门的方法其实很简单:就是(i)阅读和(ii)动手构建的结合。你不能只做其中一件而忽略另一件。正是两者的结合,才让你成为一名研究者。

实际上,成为优秀研究者的过程,和学冥想有不少相似之处:

一.

有句古老的禅语是这么说的——

*有悟之日,我们静坐。 无悟之日,我们静坐。*

做研究基本上也是这样的。科学上的洞察似乎是随机降临的。大多数日子它们不会来。成功的一个重要特质,就是投入时间和精力。和任何其他追求(音乐、体育、销售等)一样,如果你想成为世界顶尖,就需要巨大的自律。

Noam Shazeer 在 SwiGLU 论文中巧妙地致敬了成功研究想法固有的随机性:

“我们无法解释这些架构为何有效;我们将它们的成功,以及所有其他一切,都归功于神圣的仁慈。”

还有一个相关的观点是:读太多论文也是可能的。如果你想解决一个问题,行之有效的路径是:尝试一个解法,试试看,遇到瓶颈,再试着解决,只有在自己想不出办法时才去查阅文献。

二.

好吧,那我应该做什么呢?

如果你刚开始,我的诚实回答是:我觉得具体做什么主题并不那么重要。

但我会建议你,不要选择那些流行时间还不到六个月的东西。AI 发展很快,但基本思想四十年来没变过。如果你想以此为职业,我不建议你过度思考 2026 年的概念:harnesses、智能体、上下文工程等等。这些都会变化。

相反,回归基础会让你学到更多:学学什么是交叉熵,用手算一个小分布的交叉熵;深入理解 SVD,直到你能在脑海里可视化它;不要过多考虑针对编程的强化学习,而是学习策略梯度背后的思想、它们为什么有用、为什么几十年来一直流行。

再补充一点:如果你的研究项目最好的结果就是在一个已有的基准上拿到更高分数,那你的深度还不够。通常,现有的数据集无法测试新的有趣能力。

Jason Wei 也提过类似的观点

AI 研究中一个被低估但偶尔能决定成败的技能(十年前几乎不存在),就是找到真正能测试你正在开发的新方法的数据集。

至于具体建议,我给不了;那得靠你自己去发现。深入下去,专注于基础,不要追逐基准。沉浸在研究的水中,想法自然会来。

三.

初学者的心中充满可能性;专家的心中则寥寥无几——铃木

近期硅谷经常提到的一个观点是,AI 研究的经验在现代可能反而对好的研究直觉有害。我近距离观察过这种现象:许多前 Scaling 时代的研究者仍然热衷于设计小规模有效、但一旦大规模测试就会明显失败的方法。

OpenAI 真正令人印象深刻的一点是,公司里多数负责人(至少技术方面)都在 35 岁以下。ChatGPT 背后的许多重要决策者不到 30 岁。我们可以从中得到一个启示:既然 AI 是一个如此新兴的领域(ChatGPT 诞生还不到四年!),没有人有巨大的优势,因为没有人真正从事它很长时间。

简而言之,长期固守某些想法可能是有害的。保持初学者的心态,保持开放,不要让自我干扰判断。

四.

灵感的到来往往出人意料。

以下是历史上的两个例子:

  • 苯环结构的发现,据说来自一个梦:这种结构从未被见过,但在梦中被想象成一条咬住自己尾巴的蛇。
  • Ozempic 基本上来自蜥蜴。它所模拟的 GLP-1 激素最初是在吉拉毒蜥的毒液中发现的,这种沙漠蜥蜴一年只吃几次东西。不知怎么地,我们找到了让它也对人类有效的方法。

一个重要启示是:要做好研究,你必须做研究之外的事。我个人的大多数“顿悟时刻”都发生在远离键盘的时候,尤其是在散步时。

达尔文、特斯拉、费曼、亚里士多德。历史上许多伟大的思想家都强调过伸伸腿、散散步的巨大好处。即使你不做研究,你也应该多散散步。

五.

即使灵感来临,大自然也可能并不仁慈:即使实现完美,我们的想法可能在基本层面上就是不成立的。或者它曾经成立,或者看起来成立。当结果到来时,我们该如何回应?

我们可以从禅学中借用的另一个原则是(实验上的)平等心。

分析实验时:

实验成功?太棒了!

实验失败?也很棒!

两种结果教给你的信息一样多。实际上,从一连串负面结果中学到的东西往往比一个正面结果更多。“哇,还是不行——难以置信!”这才是健康的研究态度。

反过来说,你不应该对好的结果过于兴奋。事实上,很多好结果其实是源于一个 bug——并不是结果本身好,而是你测量错了,并说服了自己。每个人都希望自己的想法有效——这很好!——但所有有经验的研究者都有一个共同点:极度怀疑,尤其是面对那些好得令人难以置信的结果时。不幸的是,它们几乎总是假的。

六.

一朵花不会和旁边的花竞争。它只是绽放。

研究是非常结果导向的。尤其是在学术界,很容易看到别人纸面上的成功而产生情绪。

人们成功的原因各不相同。有些人运气好。学术评审过程尤其不一致也不公平。当你的领域有新研究出现并让你钦佩时,问问自己这个问题:

我是否在足够的深度上运作,以至于能自己做出这个发现?

有两种可能的结果。如果答案是肯定的——很好。你的流程没问题,但你没有做出这个发现;你当时忙,在做别的事,但你本可以。

如果答案是否定的——那就把它当作激励,让自己更深入。

七.

开悟前,砍柴担水。开悟后,砍柴担水。

许多成功的项目背后通常有数百小时的苦活累活。Andrej Karpathy 亲手标注了 ImageNet 的相当一部分SWEBench 的创建者——他们在许多方面走在了时代前面——花了数百小时仔细筛选 GitHub 数据,才得到一小批可用于评估的 GitHub issue。

如果你看看优秀研究者的职业生涯,他们很可能在成功之前默默工作了很长时间。习惯这一点。一个想法越有雄心、越超前,实现和评估它的工作量就可能越大。这种困难是特点,不是缺陷。

八.

Collin Raffel,一位我非常敬佩的优秀研究者,曾提到他认为许多想法的失败不是因为想法本身不好,而是因为代码里有一个研究者从未发现的 bug。

总的来说,这是一个非常棘手的问题,尤其是在 LLM 的世界里。现代深度学习软件栈极其复杂,bug 可能出现在任何地方:训练中、推理中、harness 中、数据中。

如果某些东西看起来不对劲,你就不能跳过。你应该并且可以记录很多指标,并努力理解它们。如果某些指标和你预期的不一样,你需要弄清楚为什么,因为可能有问题。我曾在推特上说过,研究者最重要的特质之一是健康的偏执。保持偏执!

九.

一个实际的问题是,涉及深度学习的大多数实验耗时太长。训练模型可能需要数周甚至数月。如今,在单个任务上评估一个模型可能需要好几天。

特别是用智能体编码时,我们的本能可能是并行启动很多实验,让它们以慢节奏运行。虽然简单的并行化有一定帮助,但上下文切换是一种有害的模式。

至关重要的是,要设计支持快速实验反馈的人体工学研究工作流。缩短训练的冷启动时间,制作能快速返回结果的小型评估。我很欣赏 Keller Jordan 的 nanoGPT 速通,它展示了从快速迭代中能学到多少东西。

(不过话说回来,有些结果无论如何都需要很长时间。当你能做到时,保持跨多天的状态,并理解本周结束的实验——这是一个非常宝贵的技能。)

十.

编码智能体能帮你更快地前进,但会加剧两个问题:我们更难理解底层细节,并且更容易进行上下文切换。优秀的研究者会主动对抗这两种力量。

Codex 可以为你写训练脚本;它甚至能执行脚本,在运行时照看它,解释结果,并给你发邮件。但也许它遇到了错误,没问你就缩短了系统提示。也许它为了在合理时间内运行评估而缩短了序列长度。也许它运行了错误的配置,因为你没指定。

从工程角度来看,这些都是小错误,很容易修复。但从科学角度来看,它们是严重的:像这样的小疏漏可能会实质性地改变论文的重要结果,因此是不可接受的。当心陷阱。即使代码不是你写的,如果你想理解结果,就需要理解产生结果的系统。

实话跟你说——这很难!把理解外包给机器很诱人。对于许多应用,这样更快。但做好科学需要学习整个系统如何工作,这样你才能确保对它的观察是真实的。没有简单的捷径。

十一.

总结:要成为成功的研究者,天赋并不是全部。性情被大大低估了。保持好奇和坚持,保持深思熟虑和一丝不苟,想法自然会来。

Сохранение в один клик

Используйте YouMind для глубокого чтения вирусных статей с помощью ИИ

Сохраняйте источники, задавайте точные вопросы, обобщайте аргументы и превращайте вирусные статьи в полезные заметки в одном рабочем пространстве ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи