豆包大模型披露评测成绩，较上一代“云雀”提升19% - Cloud&AI

C114
通信人家园
English
公众号矩阵

投稿
举报

量子大观

通信人家园

C114通信网

光通信观察

DVBCN中广5G

2024/5/27 10:15

豆包大模型披露评测成绩，较上一代“云雀”提升19%

新浪科技罗宁

5月27日上午消息，在火山引擎最新披露的一份产品资料中，豆包模型团队公布了一期内部测试结果：在 MMLU、BBH、GSM8K、HumanEval等11个业界主流的公开评测集上，Doubao-pro-4k 的总分为76.8分，相比上一代模型云雀Skylark2 的64.5分提升了19%，也优于同期测试的其他国产模型。

据悉，此次评测在今年5月完成，主要包括豆包通用模型-pro、云雀Skylark2 在内的九款国产大语言模型。除了云雀Skylark2 以外，其他模型均为各家厂商最新发布的高级版本，通过API调用进行测试。

评测结果显示，在评估代码能力的两个评测集 HumanEval 和 MBPP 上，豆包相比上一代模型提升了50%左右；在专业知识和指令遵循的评测集上，豆包分别获得33%和24%的性能提升，同时也是得分最高的国产模型。

综合11个公开评测集上的测试成绩，豆包通用模型-pro的总分为76.8分。根据OpenAI公布的测试成绩，GPT-4在这些评测集上的总分为80.1分，相比国产模型仍有一定领先优势。

免责声明：本文仅代表作者个人观点，与C114通信网无关。其原创性以及文中陈述文字和内容未经本站证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。

给作者点赞

0 VS 0

写得不太好