Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

信息来源:Anthropic:Research(发表成果 · 网页)

转载请注明出处:https://www.ysthink.site/4394/
(0)
的头像
上一页 4天前
下一页 4天前

相关推荐

  • AgentDebugX:面向LLM智能体的开源故障调试框架

    AgentDebugX是一个开源调试框架,将LLM智能体调试组织为”检测-归因-恢复-重跑”闭环。其核心DeepDebug在Who&When基准上对qwen3.5-9b达到精确的智能体与步骤归因准确率,在GAIA上单次重跑即可修复失败任务。该工具提供Python库、CLI、Web控制台和可安装的智能体技能。

    AI资讯 2026年7月21日
    00
  • Grok 推出 Automations 功能:定时或邮件触发,自动执行任务并汇报结果

    xAI 为 Grok 引入 Automations 功能,用户可描述一次任务,让 Grok 按计划(一次/每日/工作日/每周/每月/每年)或邮件触发(按发件人、收件人或主题过滤)自动运行。每次执行都是一次完整对话,结果保存至运行历史,支持邮件或应用内通知。定时自动化对所有用户开放,邮件触发需 SuperGrok 订阅。

    AI资讯 2026年7月17日
    00
  • 在 Claude Cowork 中使用 Claude Fable 5

    Anthropic 发布最强通用模型 Claude Fable 5,专为长时间、多步骤的复杂异步工作设计,可在 Claude Cowork 中自主执行深度研究、尽职调查等任务。该模型需手动选择,默认模型为 Claude Sonnet 5。

    AI资讯 2026年7月16日
    00
  • 蚂蚁百灵发布Ling-3.0-flash原生混合推理模型

    蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,并扩展至10,000+可交互训练环境,长输入下TTFT降低60%至80%以上。

    AI资讯 4天前
    00
  • Anthropic 用 Claude Code 大规模迁移代码:Bun 百万行 Zig 转 Rust,两周完成

    Anthropic 工程师用 Claude Code 在两周内将 Bun 的百万行 Zig 代码迁移至 Rust,100% 现有测试通过,合并后出现 19 个回归问题已全部修复。另一工程师用周末将 Python 代码库迁移至 16.5 万行 TypeScript。迁移消耗约 16.5 万美元 API 成本,但编译时间从八分钟降至两秒,二进制启动快 6 倍。

    AI资讯 2026年7月17日
    00

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

自6.2开始主题新增页头通知功能,购买用户可免费升级到最新版体验