智源更新大模型排行榜：豆包大模型“客观评测”排名国产第一

作者：新闻助手 2024-06-19 09:30

6月中旬，智源研究院旗下的 FlagEval 大模型评测平台发布最新榜单：在有标准答案的“客观评测”中，GPT-4 以76.11分在闭源大模型中排名第一；Doubao-Pro（豆包大模型）以75.96分排名第二，同时也是得分最高的国产大模型；其后依次是 ERNIE 4.0、Baichuan3、Moonshot-v1。在开放问答等“主观评测”中，Doubao-Pro 同样排名第二，得分超过 GPT-4o 和 GPT-4。图：豆包大模型在 FlagEval 客观评测中获综合评分第二（2024年6月）FlagEval 大

图：豆包大模型在 FlagEval 客观评测中获综合评分第二（2024年6月）

FlagEval 大模型评测平台由智源研究院与多个高校团队共建，以人类认知能力的发展阶梯为基准，对齐大模型所能达到的认知水平。FlagEval 构建了大量原创的非公开评测集，确保评测质量和公正性。自2023年6月上线以来，FlagEval 已完成了1000多次覆盖全球大模型的评测。

Doubao-Pro 是由字节跳动自主研发的大语言模型，于5月15日正式发布。本期 FlagEval 大模型排行榜，是豆包大模型在公开评测中的首次亮相。

测试成绩显示，豆包大模型的数学能力、知识运用、任务解决等多项能力在客观评测和主观评测中都有着出色表现。其中，知识运用和数学能力得分排名客观评测第一、主观评测前三，任务解决测试得分在主客观评测中均排名前三。

数学能力是评估大模型是否“聪明”的一个重要维度。此前，复旦大学自然语言处理实验室就2024 年高考数学题对13家主流大模型产品进行评测，豆包的数学高考新课标 II 卷答题获得最高分，客观题正确率达到 74.66%，成绩优于GPT-4o及国内多款大模型产品。

智源更新大模型排行榜：豆包大模型“客观评测”排名国产第一

图片来源：复旦NLP实验室公众号

据悉，豆包大模型是国内使用量最大、应用场景最丰富的大模型之一，日均处理 token 达到千亿级。其同名AI对话助手“豆包”，在苹果APP Store和各大安卓应用市场的AIGC类应用中下载量排名第一。目前，豆包大模型正在通过字节跳动旗下的火山引擎向企业市场开放服务，已经与OPPO、荣耀、小米、三星、华硕等智能终端厂商建立合作。

中文大语言模型赶考：商汤与上海AI Lab等新发布「书生·浦语」

今天，一年一度的高考正式拉开帷幕。

6/7/2023 2:48:00 PM

机器之心

智源发布FlagEval“百模”评测结果丈量模型生态变局

2024年12月19日，智源研究院发布并解读国内外100余个开源和商业闭源的语言、视觉语言、文生图、文生视频、语音语言大模型综合及专项评测结果。相较于今年5月的模型能力全方位评估，本次智源评测扩展、丰富、细化了任务解决能力内涵，新增了数据处理、高级编程和工具调用的相关能力与任务；首次增加了面向真实金融量化交易场景的应用能力评估，测量大模型的收益优化和性能优化等能力；首次探索基于模型辩论的对比评估方式，对模型的逻辑推理、观点理解、语言表达等核心能力进行深入分析。智源评测发现，2024年下半年大模型发展更聚焦综合能力提升与实际应用。

12/19/2024 6:00:00 PM

大模型 2024 高考发榜，豆包等三款国产 AI 考上文科一本线

眼下，全国各地的高考成绩陆续出炉，各种关于考生考了多少分的新闻也在不断登上头条。而最近，有一批特殊考生的成绩也出炉了，他们就是由各家 AI 大模型组成的“考试天团”。大模型考上文科本科，豆包拿下国产 AI 最高分6 月 24 日，在极客公园最新发布的高考新课标 Ⅰ 卷大模型评测报告中，GPT-4o 以 562 分排名文科总分第一。国内产品中，字节跳动旗下的豆包拔得头筹，成绩是 542.5 分。再往后，依次是百度文心一言 4.0 的 537.5 分、百川智能“百小应”的 521 分。本次大模型高考评测与河南省考卷完全

6/26/2024 5:55:20 PM

汐元

智源更新大模型排行榜：豆包大模型“客观评测”排名国产第一

相关资讯

中文大语言模型赶考：商汤与上海AI Lab等新发布「书生·浦语」

智源发布FlagEval“百模”评测结果 丈量模型生态变局

大模型 2024 高考发榜，豆包等三款国产 AI 考上文科一本线

智源发布FlagEval“百模”评测结果丈量模型生态变局