AIGC宇宙 AIGC宇宙

揭开大模型的秘密!那些 “思考词” 背后藏着惊人的信息量

近日,来自中国人民大学、上海人工智能实验室、伦敦大学学院和大连理工大学的研究团队揭示了大模型推理过程中的一个重要发现:当模型在思考时,所使用的 “思考词” 实际上反映了其内部信息量的显著提升。 这一研究成果通过信息论的方法,为我们更好地理解人工智能的推理机制提供了新的视角。 论文地址:,会输出一些看似人类化的语言,比如 “嗯……”、“让我想想……” 或 “因此……”。

近日,来自中国人民大学、上海人工智能实验室、伦敦大学学院和大连理工大学的研究团队揭示了大模型推理过程中的一个重要发现:当模型在思考时,所使用的 “思考词” 实际上反映了其内部信息量的显著提升。这一研究成果通过信息论的方法,为我们更好地理解人工智能的推理机制提供了新的视角。

image.png

论文地址:https://arxiv.org/abs/2506.02867

你或许见过大模型在解答问题时,会输出一些看似人类化的语言,比如 “嗯……”、“让我想想……” 或 “因此……”。这些 “思考词” 是简单的表面装饰,还是代表着模型真正的思考过程?这个问题困扰着许多研究者。如今的研究表明,这些词汇并非仅仅是为了模仿人类,而是关键的 “信息高峰”,显示出模型在特定时刻的思维状态。

人工智能大脑 大模型 (2)

图源备注:图片由AI生成,图片授权服务商Midjourney

研究团队对多种大模型进行追踪观察,测量它们在推理过程中的互信息变化。结果发现,模型在某些时刻的互信息值会急剧上升,形成明显的 “互信息峰值”。这意味着,在这些关键时刻,模型内部包含了指向正确答案的关键信息。这一现象在经过推理强化训练的模型中表现得尤为明显,而非推理模型则显得较为平淡。

image.png

更为有趣的是,当研究人员将这些互信息高峰时刻的表征转化为人类可理解的语言时,发现这些时刻正好对应了那些频繁出现的 “思考词”。例如,在进行复杂推理时,模型往往会输出 “让我想想”、“所以我必须……” 等表述。这些 “思考词” 不再是可有可无的点缀,而是模型推理过程中的关键路标,推动着其思考的进展。

基于这一发现,研究者们提出了两种无需额外训练就能提升大模型推理能力的方法。这意味着,未来的 AI 可以在保留现有知识的基础上,通过合理利用这些信息高峰,显著提升其推理性能。这一研究不仅推动了大模型的理论研究,也为实际应用提供了新的思路。

相关资讯

腾讯云上线DeepSeek全系API接口并打通联网搜索

腾讯云宣布完成对深度求索(DeepSeek)大模型的深度整合——正式上线DeepSeek-R1和V3原版模型的API接口,并创新性接入自研大模型知识引擎,同步开放联网搜索能力。 凭借腾讯云在推理并发和生成速率等方面的优化,用户可以获得更加稳定、安全、低门槛的使用体验。 开发者只需在云上简单三步即可实现API接口调用,并通过大模型知识引擎提供的文档解析、拆分、embedding、多轮改写等能力,灵活构建专属的AI服务。
2/8/2025 2:09:00 PM
AI在线

微信搜索接入DeepSeek大模型 称AI不会使用朋友圈聊天等信息

近日,微信宣布其搜索功能接入 DeepSeek-R1模型,目前处于灰度测试阶段。 部分用户在微信搜索框选择 AI 搜索时,可体验到 DeepSeek-R1提供的深度思考功能。 微信方面表示,引入大模型旨在提升搜索的智能化和精准度,更好地理解用户搜索意图,分析处理复杂查询。
2/19/2025 11:18:00 AM
AI在线

DeepSeek-R1 登顶 Hugging Face:以10000 赞力压 150 万个模型

今日凌晨,全球最大开源平台之一 Hugging Face 的首席执行官 Clement Delangue 在社交平台发文宣布,DeepSeek-R1在 Hugging Face 上获得了超过10000个赞,成为该平台近150万个模型中最受欢迎的大模型。 这一里程碑式的成就标志着 DeepSeek-R1在全球 AI 社区中的广泛认可与影响力。 DeepSeek-R1的崛起速度令人瞩目。
2/24/2025 9:30:00 AM
AI在线
testab