当前位置：首页 >人工智能 >SuperCLUE中文大模型评测：商汤商量揽总榜、AI智能体两项第一

SuperCLUE中文大模型评测：商汤商量揽总榜、AI智能体两项第一

发布时间：2023-11-28 14:54:58 浏览量：98次

近日，中文通用大模型综合性评测基准SuperCLUE发布9月总排行榜和各个分类任务榜单，商汤商量SenseChat 3.0 位列中文大模型总榜排名第一。

近日，中文通用大模型综合性评测基准SuperCLUE发布9月总排行榜和各个分类任务榜单，商汤商量SenseChat 3.0 位列中文大模型总榜排名第一。在新增的AI Agent（AI智能体）子榜中，SenseChat 3.0 同样排名第一，领先所有国内中文大模型以及GPT-3.5 和 Claude 2，表现仅次于GPT-4，展示了商汤在大模型领域创新发展及释放生产力的优势，以及在探索AGI道路上的积累与潜力。

注：国外代表性模型（GPT4.0/Claude2/gpt-3.5）不参与排名。

SuperCLUE是中文通用大模型的综合性评测基准，旨在对大模型在各个能力维度上的表现进行全方位的评估，是国内最具专业性和代表性的中文大模型评测基准之一。此次评测选取了目前国内外最具代表性的20个通用大语言模型。

商量总榜第一，客观题成绩超GPT-3.5

9月最新发布的SuperCLUE总排行榜和各个分类任务榜单，主要聚焦于大模型的四个能力象限，语言理解与生成，包括语言理解与抽取、上下文对、生成与创作、角色扮演；专业技能与知识，包括知识与百科、计算、代码、逻辑与推理；Agent智能体，包括工具使用、任务规划；安全性，包括系统安全、指令攻击，总共12项基础能力。

在总排行榜中，商汤科技商量SenseChat 3.0以总分62.75分位列第一，其中在OPT客观题部分，商汤SenseChat 3.0得分还超过了GPT-3.5，展示了在中文大模型方面极强的综合竞争力。

商汤商量SenseChat于2023年4月正式推出，是国内最早的基于千亿参数大语言模型之一，并不断迭代更新。其背后依托的是商汤AI大装置SenseCore，目前上线GPU数量约30,000块，算力规模提升至6 ExaFLOPS，有效支持语言大模型的训练、升级迭代和服务。

推动AI智能体发展，加速迈向AGI

随着大模型发展，“聊天”已远远不能满足人们的要求，能够准确使用工具成为解放大模型生产力的关键。SuperCLUE新增的AI Agent（AI智能体）子榜，是业界首个AI Agent榜单，它重点评估了AI Agent在“工具使用”和“任务规划”两个关键能力上的表现。评测显示商汤商量SenseChat 3.0具备作为人类超级助手的潜力，可以根据人类需求自主完成任务，进而充分释放大模型的生产力，使其在 AI Agent 榜单上表现仅次于GPT-4，全面领先其余参评大模型。

目前全球领先的AI 智能体，几乎都以领先大模型GPT-4为核心驱动，它们借助强大的工具使用能力等，可将复杂问题拆解成可实现的子任务、类人的自然语言交互等能力。商量SenseChat 3.0作为领先的中文大模型，通过使用代码解释器、API调用和搜索三类常用工具来解决复杂任务，灵活搭建AI智能体应用，支撑企业的生产力革新。

目前，商量SenseChat已经在金融、手机、医疗、汽车、地产、能源、传媒、工业制造等众多垂直行业与超过500家客户建立了深度合作。作为具备强大工具使用能力的大模型，商量SenseChat的持续快速提升，为商汤发展更强大的、能够像人类一样进行交互的AI智能体，以及面向AGI道路的探索，都将提供重要的基础和支撑。

上一篇北师大未来设计学院在第六届中国教博会发布五项PBL大挑战项目

下一篇 10月12日，第四届深圳国际人工智能展盛大开幕

热门课程推荐

热门资讯

1. 照片变漫画效果，这4个方法操作简单有效，快来试试吧！

想将照片变成漫画效果？这篇文章分享了4个方法，包括Photoshop、聪明灵犀、VanceAI Toongineer、醒图，简单操作就能实现，快来尝试一下吧！
2. 华为手机神奇“AI修图”功能，一键消除衣服！原图变身大V领深V！

最近华为手机Pura70推出的“AI修图”功能引发热议，通过简单操作可以让照片中的人物换装。想了解更多这款神奇功能的使用方法吗？点击查看！
3. 四款值得推荐的AI以图生图软件，有需要的赶紧来试试!

近年来,人工智能逐渐走入公众视野,其中的AI图像生成技术尤为引人注目。只需在特定软件中输入关键词描述语以及上传参考图就能智能高效生成符合要求的...
4. AI视频制作神器Viggle：让静态人物动起来，创意无限！

Viggle AI是一款免费制作视频的AI工具，能让静态人物图片动起来，快来了解Viggle AI的功能和优势吧！
5. Logo Diffusion——基于sd绘画模型的AI LOGO 生成器

这下LOGO设计彻底不用求人了。接下来详细演示一遍操作流程首先进入Logo D... 想学习更多AI技能,比如说关于怎么样利用AI来提高生产效率、还能做什么AI...
6. AI显卡绘画排行榜:4090无悬念，最具性价比出人意料

在AI绘图领域，Stable Diffusion的显卡绘图性能备受关注。本文整理了Stable Diffusion显卡的硬件要求和性能表现，以及2023年3月显卡AI绘图效率排行榜和性价比排行榜。欢迎查看最新的AI显卡算力排行榜。
7. 零基础10分钟生成漫画，教大家如何用AI生成自己的漫画

接下来,我将亲自引导你,使用AI工具,创作一本既有趣又能带来盈利的漫画。我们将一起探索如何利用这个工具,发挥你的创意,制作出令人惊叹的漫画作品。让...
8. 赶紧收藏好!这4个完全免费的AI视频制作网站和工具

以下是一些免费的AI视频制作网站或工具,帮助您制作各种类型的视频。 1. Lumen5:Lumen5是一个基于AI的视频制作工具,可将文本转换为视频。用户可以使...
9. 四款软件让你一键生成AI美女!

就能快速生成一幅极具艺术效果的作品,让现实中不懂绘画的人也能参与其中创作!真的超赞哒~趣趣分享几款超厉害的AI绘画软件,提供详细操作!有需要的快来...
10. 10个建筑AI工具，从设计到施工全覆盖!肯定有你从来没听过的

讲述了建筑业比较著名的AI公司小库科技做出的探索,在这儿就不多说了。今天,我们试着在规划设计、建筑方案设计、住宅设计、管道设计、出渲染图、3D扫...

SuperCLUE中文大模型评测：商汤商量揽总榜、AI智能体两项第一

请绑定手机号