[ 云计算 | 亚马逊云科技 ] ChatGPT 竞争对手 Claude 3 上线亚马逊云,实测表现超预期

云计算
Amazon Bedrock
技领云博主
0
0
### 一、前言 3月4号,Anthropic 发布了号称现阶段宇宙最强大模型 Claude 3,到底强到什么程度,直接看这张图即可。 发文时间点 **Claude 3 Sonnet 模型现已在亚马逊云科技的 [Amazon Bedrock](https://aws.amazon.com/cn/bedrock/?trk=cndc-detail) 正式可用,本文第三节会介绍如何在亚马逊云科技上使用 Claude3 模型**。 ![image.png](https://dev-media.amazoncloud.cn/85489c2b7b5b4a06bacff95e87bbafa3_image.png "image.png") ### 二、Claude 3 介绍以及相关测试细节 这次发布包括了三个版本:Claude 3 Haiku、Claude 3 Sonnet和Claude 3 Opus,它们的能力从低到高。 首先是 Haiku,它是市场上速度最快、成本效益最高的选择,对于大部分的纯文本任务表现出色,同时也支持多模态能力。 Sonnet 则比之前的 Claude 2 和 Claude 2.1 快两倍,并且智能水平更高。它擅长处理需要快速响应的智能任务,比如知识检索或者销售自动化。它在智能和速度之间达到了完美平衡,这对企业应用来说尤为重要。 Opus 是最顶级、最强大的基础模型,具备深度推理、高级数学和编码能力,在高度复杂的任务上表现出色。它能够流畅地处理各种开放式提示和新颖场景,包括任务自动化、假设生成以及图表、图形和预测的分析。适用于需要高度智能和复杂任务处理的场景,比如企业自动化、复杂金融预测、研究和开发等。 Claude 3 Haiku、Claude 3 Sonnet和Claude 3 Opus的能力可以参考下面的图示: ![image.png](https://dev-media.amazoncloud.cn/bb2fe17b4ca740f1aba9d21e568d7319_image.png "image.png") 在相关测评中,Opus表现出色,多项基准测试中的得分都超过了GPT-4和Gemini 1.0 Ultra,在数学、编程、多语言理解、视觉等多个维度上树立了新的行业标准。特别是在特定测试场景下,如研究生水平考试Q题解A和数学Q题解决上,Claude 3的表现优于GPT-4。比如,在zero-shot学习环境下,Claude 3的准确率达到了60%,超过了GPT-4的52%。 在 Babel.cloud 开源评估项目的 LLMRGB 项目中,**Claude3 在单次测试中获得了高达97.6的高分**,大大超过了GPT-4,成为当前大型模型能力的领先者。 ![image.png](https://dev-media.amazoncloud.cn/87aac5d769bc4abca3bc474851f21706_image.png "image.png") (测试结果图片以及仓库见文末参考文献) 要特别注意的是,在 LLM-RGB 评估中,015_simple_mahjong 是个超级难题。简单地说,大型模型被教了一些简单的麻将规则,还给了一些例子,然后要求在一个具体情境下做出选择。这个问题在以前的测试中很少有人能正确解答。不过,Claude 3 Opus 有20%的几率给出最佳解答,还有80%的几率给出次优解。这意味着它的多轮推理能力远远超过其他模型,能够快速学习并应用有限的知识。这使得 Claude 3 的应用领域不仅限于简单的客服和文本生成,它在工程过程更长的领域也能表现出色。 ### 三、在亚马逊云科技上体验 Claude 3 #### 3.1 在 Amazon Bedrock 服务中配置 Claude 3 目前,Anthropic 的 Claude 3 Sonnet 模型现已在亚马逊云科技的 [Amazon Bedrock](https://aws.amazon.com/cn/bedrock/?trk=cndc-detail) 正式可用。目前可以完全免费试用。 Amazon 上的体验服务入口:https://portal.cloudassist-beta.sign-up.china.aws.a2z.com/demo/qrcode?trk=KOCKOL?trk=cndc-detail 进入后无需注册账号,仅需要扫码进入 CloudAssist,然后点击限时试用即可,如下图 > 下一代 Claude (Claude 3) 的三个模型 Claude 3 Opus、Claude 3 Sonnet 和 Claude 3 Haiku 将陆续登陆 [Amazon Bedrock](https://aws.amazon.com/cn/bedrock/?trk=cndc-detail)。**[Amazon Bedrock](https://aws.amazon.com/cn/bedrock/?trk=cndc-detail) 是目前第一个也是唯一一个提供 Claude 3 Sonnet 的托管服务**。 ![image.png](https://dev-media.amazoncloud.cn/5035b12afc7e4b7292c7e100efdd894b_image.png "image.png") 在 [Amazon Bedrock](https://aws.amazon.com/cn/bedrock/?trk=cndc-detail) 服务中,点击下面的入门按钮 ![image.png](https://dev-media.amazoncloud.cn/013fcadddd334ebca0896855fae1b2db_image.png "image.png") 进入到 [Amazon Bedrock](https://aws.amazon.com/cn/bedrock/?trk=cndc-detail) 后,首先需要管理模型的访问权限,这后面需要申请所需的模型,在这个步骤直接点击 \[管理模型访问权限] 按钮即可。 ![image.png](https://dev-media.amazoncloud.cn/c1d5eb59a5de49d1ae4bc2a2b68bd47a_image.png "image.png") 进入到模型列表页面后,可以看到 [Amazon Bedrock](https://aws.amazon.com/cn/bedrock/?trk=cndc-detail) 中内嵌了很多模型,不过这些模型默认没有配置访问,这需要你做访问请求,也就是继续点击配置模型访问权限操作。 ![image.png](https://dev-media.amazoncloud.cn/e055b5682c794af4943f5de84b07b60a_image.png "image.png") 进入到模型请求访问权限页面后,可以看到 Anthropic 公司的模型,在做请求之前,需要先提交应用场景。如下图 ![image.png](https://dev-media.amazoncloud.cn/e5684bc7a3ed4092b513bf727a2dd2ff_image.png "image.png") 下面的信息是必填信息,需要填写后,按钮才会高亮,允许继续点击 ![image.png](https://dev-media.amazoncloud.cn/51b277a2bf7a4c4bae0b895e1fffc373_image.png "image.png") 在上一步点击提交按钮后,勾选所需的模型,这里直接全选了所有模型做请求。 ![image.png](https://dev-media.amazoncloud.cn/02684f9c049546a3acaab21a19aa64f3_image.png "image.png") 最后请求过程中可能需要等待几分钟。等待请求完成即可。 ![image.png](https://dev-media.amazoncloud.cn/da3c0d9c17bb46d4b8fe013412bbe6cc_image.png "image.png") #### 3.2 为聊天配置使用 Claude 3 模型 在上述步骤配置好后,在 [Amazon Bedrock](https://aws.amazon.com/cn/bedrock/?trk=cndc-detail) 页面,选择聊天菜单,之后点击【选择模型】按钮,选择 Claude 3 模型。 ![image.png](https://dev-media.amazoncloud.cn/740c15adc38f47259f49611591c9f7bf_image.png "image.png") 进入到模型选择页面,选择 Anthropic 公司中的 Claude 3,点击应用即可。 ![image.png](https://dev-media.amazoncloud.cn/df04d16c03ef48ae8f38958c7d8f9648_image.png "image.png") #### 3.3 Caude 3 Sonet 聊天体验 第一个问题我是直接问他使用pyhon写一个3次的循环,可以看出 Caude 3 不局限一种方式书写,并且将多个实现写出,后面并且给出的测试打印结果。可以说你后面想问的或者拓展的很好。 ![image.png](https://dev-media.amazoncloud.cn/a12b782aa19c4587b38928241e145b71_image.png "image.png") 接下来我使用 Claude 3 进行了一个图片识别,并且让 Claude 3 进行了分析总结, 传给 Claude 3 的图片是一张中国地图,并且带有一些描述信息。 可以看到最后 Claude 3 给的分析总结非常精准,精准到我有点吃惊。 ![image.png](https://dev-media.amazoncloud.cn/3a5ba7338df94d8ea4a5594852d43444_image.png "image.png") 对图片进行识别的测试,我上传了一只猫,可以看到 Claude 3 不仅分析了动物是什么,还直接描述了这个图片中猫的场景动作。 ![image.png](https://dev-media.amazoncloud.cn/a3f8a00d385c4b9599e0249f6bbb57a8_image.png "image.png") 另外一个让我吃惊的是,我上传了一张车的图片,让他识别出来车的型号,Claude 3 可以几乎精准识别。问题以及 Claude 3 的回答可以看下图。 ![image.png](https://dev-media.amazoncloud.cn/ab5bf6e894b74075bd8129eb7580363c_image.png "image.png") ### 四、文末总结 个人觉得,Claude 3 的超预期成功并不意味着 Anthropic 的能力已经完全超越了OpenAI。现在看 Claude 3 显然比 GPT4 更强大,但也许GPT-5 已经在 OpenAI 手中了。 然而,Claude 3 的出现表明大型模型领域不再由单一实体主导,也没有只有 OpenAI 才能创造的“核心魔法”。更多地涉及领先于工程能力和资源投入。大型基础模型之间的竞争为上层应用开发人员提供了更多选择,并将不可避免地带来更低的价格。从这个角度来看,无论 Claude 3 的成功被高估了多少,都带来了重要的行业价值和社会影响。 ### 五、参考文献 - https://github.com/babelcloud/LLM-RGB?trk=cndc-detail - https://llm-rgb.babel.run/view/testId/a581e4a9-ce1e-4b2f-8f45-980889913b58?trk=cndc-detail - https://mp.weixin.qq.com/s?__biz=MzA4ODMwMDcxMQ==&mid=2651122739&idx=1&sn=667fcc30565cb1ba6510307747fbf78e&trk=cndc-detail **前述特定亚马逊云科技生成式人工智能相关的服务仅在亚马逊云科技海外区域可用,亚马逊云科技中国仅为帮助您了解行业前沿技术和发展海外业务选择推介该服务。*
0
目录
关闭