文章提交注意事项:
请在发布文章时用HTML代码加上至少一条新闻来源的链接;原创性消息,可加入相关信息(如涉及公司的网址)的链接。有任何问题,邮件至:he.fang#zhiding.cn
注意:收到邮件乱码的用户请修改客户端的默认字体编码,从"简体中文(GB2312)"修改为"Unicode(UTF-8)"。
solidot新版网站常见问题,请点击这里查看。
Solidot 公告
投 票
热门文章
-
- 德国法庭裁决 Meta 要为其平台上第三方发布的虚假广告承担责任 (0)
- 微塑料像特洛伊木马一样传播有毒物质 (0)
- 朝鲜地下核试验诱发了持续多年的地震活动 (0)
- Waymo 将在新加坡提供无人出租车服务 (0)
- NASA 和 IBM 开源月球模型 (0)
- 新疆东天山古人主要来自东亚和北亚 (0)
- 美国政府网站使用了阿里巴巴的千问模型 (0)
- 韩国的超老龄化问题 (0)
- 美国的富裕社区更可能发生火灾 (0)
- 科学家识别了一种新猫科动物 (0)
热门评论
- 很正常 (1 points, 一般) by Craynic 在 2026年07月27日13时22分 星期一 评论到 古代语言的多样性远超今日
- 发电不需要油吗 (1 points, 一般) by Craynic 在 2026年06月03日13时51分 星期三 评论到 能源危机推动 37 个国家的电动汽车销量创新高
- 所以firefox 已经路边一条,对用户的需求漠视的结果就是这样了 (1 points, 一般) by solidot1745479987 在 2026年04月20日11时14分 星期一 评论到 Firefox 加入了对 Web Serial API 的支持
- (1 points, 一般) by solidot1775703930 在 2026年04月09日11时09分 星期四 评论到 Sam Altman 能被信任吗?
- 很难想象现代Linux居然还能跑在i486上 (1 points, 一般) by Craynic 在 2026年04月07日19时41分 星期二 评论到 Linux 准备移除对 i486 CPU 的支持
- 很多单词已经不再实用 (1 points, 一般) by Craynic 在 2026年04月07日13时22分 星期二 评论到 人们日常说话的单词量比上一年减少 300 个单词
- 表示方向不还是得有那么多个维度吗 (1 points, 一般) by Craynic 在 2026年03月30日13时35分 星期一 评论到 Google TurboQuant AI 压缩算法大幅减少大模型内存使用
- sora的核心用户是内容创作者 (1 points, 一般) by Craynic 在 2026年03月27日13时16分 星期五 评论到 Sora 为何失败:每天推理成本最高 1500 万美元总收入仅为 210 万美元
- 夏天骑摩托的时候,最喜欢带着有线耳机听相声或小说 (1 points, 一般) by kracker1911 在 2026年03月17日09时36分 星期二 评论到 有线耳机销量暴增
- 不如用网易邮箱 (1 points, 一般) by Craynic 在 2026年03月10日11时20分 星期二 评论到 FBI 通过 Proton Mail 识别抗议者身份
过去两年人工智能程序的语言流畅度达到了惊人的水平。其中最优秀的程序都是基于 2017 年发明的、被称为 Transformer 的架构。它以方程式列表的形式,作为程序遵循的一种蓝图。除了这个简单的数学概述之外,我们不知道 Transformer 对处理的单词做了什么。普遍的理解是它们以某种方式同时关注多个单词,从而可以立即进行“大图景”分析,但究竟是如何工作的——或者甚至这是否是准确理解 Transformer 的方式——都还不清楚。我们知道成分,但不知道配方。Anthropic 公司的研究人员进行的两项研究开始从根本上弄清楚 Transformer 在处理和生成文本时在做什么。在 12 月发布的首篇论文中,他们着眼于架构的简化版本并充分解释了它们的功能。作者还展示了从学习基本语言模式到获得语言处理通用能力的简单 Transformer。
在 3 月8 日发表的第二篇论文中,研究人员表明,负责这种能力的相同组件在最复杂的 Transformer 中也发挥作用。虽然这些模型的运算在很大程度上仍难以理解,但是这些结果为理解提供了一个途径。理解Transformer 的难点在抽象性。传统程序遵循着一个可以理解的过程,如看到“绿色的”时输出“草”,而Transformer 则是将“绿色的”这个单词转换为数字,然后将其乘以某些值。这些值(也被称为参数)决定下一个单词是什么。它们在训练过程中得到微调,模型在这个过程中学会了如何产生最佳输出,但尚不清楚模型在学习的是什么。大多数机器学习程序将运算打包成模块化的成分,这些成分被称为神经元。Transformer 加入了一种额外的成分,被称为注意力头(attention head),成组的头分层排列(就像神经元一样)。但是头执行的操作和神经元完全不同。头通常被理解为允许程序记住输入的多个单词,但这种解释远非定论。
在 3 月8 日发表的第二篇论文中,研究人员表明,负责这种能力的相同组件在最复杂的 Transformer 中也发挥作用。虽然这些模型的运算在很大程度上仍难以理解,但是这些结果为理解提供了一个途径。理解Transformer 的难点在抽象性。传统程序遵循着一个可以理解的过程,如看到“绿色的”时输出“草”,而Transformer 则是将“绿色的”这个单词转换为数字,然后将其乘以某些值。这些值(也被称为参数)决定下一个单词是什么。它们在训练过程中得到微调,模型在这个过程中学会了如何产生最佳输出,但尚不清楚模型在学习的是什么。大多数机器学习程序将运算打包成模块化的成分,这些成分被称为神经元。Transformer 加入了一种额外的成分,被称为注意力头(attention head),成组的头分层排列(就像神经元一样)。但是头执行的操作和神经元完全不同。头通常被理解为允许程序记住输入的多个单词,但这种解释远非定论。