首页 > 自考资讯 > 高考百科

「LLM」这个名字不好,Karpathy认为不准确、马斯克怒批太愚蠢?马斯克中文名

小条 2024-09-30

机器心脏报告

编辑:陈晨

LLM应该改名吗?

在人工智能领域,大多数人谈论的是大规模语言模型。英文的正式名称是Large Language Models(缩写为LLM)。

由于LLM里面有“语言”这个词,所以大家都认为这个技术和语言密切相关。

但著名人工智能专家安德烈·卡帕蒂(Andrei Karpathy)对此有着独特的见解。

5315ce3b070a45bdbcfa949d21e8bce5~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=9efzGZpYvbRPLwvUrS3JlEXjJuc%3D“虽然Large-Scale Language Model(LLM)这个名字包含了语言这个词,但实际上和语言关系不大。这只是一个历史问题。更准确的名字应该是Autoregressive之类的东西变压器。

LLM 是一种流行的统计建模技术,主要使用自回归转换器来模拟token 流,这些token 的范围可以是文本、图像、音频、动作选择,甚至可以表达任何东西。因此,只要能够将问题转化为模拟一组离散令牌的过程,理论上就可以使用LLM来解决问题。

事实上,随着大型语言建模技术栈的成熟,越来越多的问题可能会被纳入到这种建模范式中。换句话说,问题是用LLM“预测下一个token”来解决的,但是每个领域的token的目的和含义是不同的。

如果真正的核心问题是预测下一个令牌,那么PyTorch 及其同类框架等深度学习框架也可能过于通用,并且随着时间的推移无法满足大多数问题的需求。如果你只需要使用LLM 解决80% 的问题,那么拥有数千个可以自由重新配置的操作和层有什么意义呢?我不认为这是真的,但我认为这只是对了一半。 ”

卡帕蒂先生的言论引起广泛关注,浏览量超过20万次。

7c1097f202554d3aa22011c4d32d4baf~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=DhDjHm5FT4XOyK2AfH4TEqQFFUE%3DKarpathy 在加入Tesla 领导自动驾驶计算机视觉团队之前是OpenAI 的早期成员。然后他回到OpenAI 领导一个小团队,专注于改进ChatGPT 的GPT-4。今年7月,他宣布创立一家AI+教育公司,名为Eureka Labs。

da21db93bb5644859da82ae9d22626cf~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=GFP9nNTkkNFJ9q9flr1e%2FnKiaQM%3D 坐在前排的马斯克先生非常同意。这肯定需要一个新名字。 “Multimodal LLM(多模态大语言模型)”是一个特别愚蠢的名字,因为第一个词和第二个词相同。三个词是矛盾的。

a0090ce2a1f0409a8ed671f4a9639da7~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=sWQSUQf5EV43002431gvIFk8x8Y%3D 机器学习和人工智能研究员,畅销书作者《Python 机器学习》 Sebastian Raschka 强烈同意。如果LLM更名为Autoregressive Transformer或其他名称,Mamba、Jamba和Samba可以申请参加吗?无论如何,我完全同意卡帕蒂的观点。

d9f5b1876c384fa9af549eb1299f550d~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=HUBvtvzoxq1M3NkVsCn1AH5kyhg%3D 然而,正如OpenAI 研究员Clive Chan 所说:另一方面,任何可以以所谓的自回归方式表达的东西都可以被视为一种语言。从这个角度来看,一切都是语言,因为一切都可以转换成令牌流。

卡帕蒂先生对此声明作出回应说:当然,你可以想象声音的质感、声音的分子等等。然而,我观察到,语言这个词给人们一种错误的印象,即大规模语言模型(LLM)仅限于文本应用。

bf305b882ae749a08d6f95431231fe03~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=1Tl7xDgMsURvy1rTrv9m5n97ns0%3D Meta 的PyTorch 工作人员Horace He 说道:诚然,深度学习框架在某些方面可能过于笼统。然而,大型语言模型(LLM) 的实际作用却截然不同。这包括新的注意力操作、混合专家模型(MoE)、激活检查点的不同变体、不同的位置嵌入等等。

Horace He 认为,这些技术的多样性推动了深度学习框架的多功能性的需求,以适应不断发展和变化的模型需求,甚至对于以法学硕士为重点的应用程序也是如此。

d702aadd5efe47f8b06e539514d4fedf~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=h5D1HHCbdPLkMxOfixBiTwaQhvw%3D “有点奇怪的是,像LLM、GPT、RLHF这样的术语现在正在成为主流。通常一个领域在向更广阔的世界介绍自己时不会做这样的事情(而且在我看来,这也是一些研究机构)(品牌推广失败的原因)”一位人士表达了这样的观点。

这种情况反映了这样一个事实,即复杂术语的盛行并不总是有效地代表其真实用途或影响,并且在某些情况下可能会导致公众理解上的困难。

3aca924ec65c4506a8cadd51a7d5a42c~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=8yRQYYb5O0GXDj%2BBhxWrY3xgkrc%3D 有网友认为,“大”字不太好,因为今天的“大”将来看起来就像“小”。

f96f7528a39148798cb914410be7e300~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=AOM6QA6k7qh%2BD6dPNWVh%2B46K0BU%3D “手机和电脑也是如此,似乎有保留原始术语的趋势。”

39edd6e7dde2485c96a3cabe9a2438e7~noop.image?_iz=58558&from=article.pc_detail&lk3s=953192f4&x-expires=1728312443&x-signature=8YA%2BKUkzAeOVXO9BQ2V82ql85VM%3D 这让我想起了人工智能领域的不同命名约定。由于先入之见,早期的名称经常被广泛使用,尽管随着技术的发展,这些名称可能不再准确地描述其功能。

您认为大型语言模型是否应该重命名?

参考链接:https://x.com/karpathy/status/1835024197506187617

版权声明:本文转载于网络,版权归作者所有。如有侵权,请联系本站编辑删除。

猜你喜欢