加载中...
Anthropic于2024年6月发布的Claude 3.5系列首款模型,在编程能力(SWE-bench 49%)和视觉理解上超越了同期所有竞品,并引入了computer use功能,让AI能操控真实电脑桌面完成任务。

| 开发者 | Anthropic |
| 发布时间 | 2024年6月 |
| SWE-bench得分 | 49%(发布时最高) |
Claude 3.5 Sonnet在SWE-bench Verified测试(让AI修复真实GitHub仓库中的Bug)上取得49%的成绩,而发布前最好成绩约为20%多,这是AI在软件工程测试上的重大跃升。在TAU-bench(工具调用代理测试)和多个代码生成基准上也处于当时的SOTA位置。
实际使用中,开发者反映Claude 3.5 Sonnet在多文件代码理解、bug定位、API文档理解上明显优于GPT-4o,Cursor编辑器因此将其作为默认模型。[1]
2024年10月,Anthropic发布了computer use功能(公测):Claude能接受屏幕截图输入,并输出键盘/鼠标操作指令,像人类一样操控电脑——打开浏览器搜索、填写表单、操作文件、执行终端命令。这是第一个由顶级AI公司正式推出的「通用电脑操控」能力。
发布时Anthropic明确说明这处于早期「beta」阶段,容易出错、速度慢,适合探索而非生产使用。主要应用场景:RPA(机器人流程自动化)、自动化测试、数据录入等。

| 开发者 | Anthropic |
| 发布时间 | 2024年6月 |
| SWE-bench得分 | 49%(发布时最高) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧