代理群(Agent Swarm)通过树状分解在构建 SQLite(Rust 版)任务中达到 80% 测试通过率

一项实验证明,将任务分解为规划者与执行者的树状结构后,代理群在四小时内用 Grok 4.5 达到 80% 的 SQL 测试通过率,而旧版代理群在第二小时前即失败。新系统峰值提交速度达每秒 1,000 次,为此团队从零构建了专用版本控制系统。该架构已在构建浏览器、修复漏洞及生成数十亿 token 合成数据等任务中验证。

一项实验证明,将任务分解为规划者与执行者的树状结构后,代理群在四小时内用 Grok 4.5 达到 80% 的 SQL 测试通过率,而旧版代理群在第二小时前即失败。新系统峰值提交速度达每秒 1,000 次,为此团队从零构建了专用版本控制系统。该架构已在构建浏览器、修复漏洞及生成数十亿 token 合成数据等任务中验证。

信息来源:Hacker News 热门(buzzing.cc 中文翻译)

转载请注明出处:https://www.ysthink.site/4408/
(0)
的头像
上一页 2026年7月21日
下一页 2026年7月21日

相关推荐

  • SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

    SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。

    AI资讯 6天前
    00
  • Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

    月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。

    AI资讯 1天前
    00
  • ChatGPT 桌面版上线语音控制多智能体

    ChatGPT 语音功能现已登陆桌面应用。

    只需使用语音,即可控制你的电脑,并指挥在 ChatGPT Work 或 Codex 中运行的多个智能体。

    该功能由 GPT-Live 驱动,因此它能够同时在该应用中说话、聆听并协调工作。

    今日起,面向 macOS 和 Windows 平台的 Plus、Pro、Business、Edu 及 Enterprise 计划用户全球推送。

    AI资讯 5天前
    00
  • Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准

    Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。

    AI资讯 2026年7月17日
    00
  • Ollama 获 8800 万美元融资,加速开放模型生态发展

    Ollama 宣布完成 8800 万美元融资,由 Benchmark、Theory Ventures 和 8VC 等领投。该平台已服务 890 万开发者,并被 85% 的财富 500 强企业使用,其云端 token 用量月均翻倍。资金将用于支持无缝混合推理、新模型发布当日集成,以及让开发者在不牺牲所有权和隐私的前提下使用最强开放模型。

    AI资讯 2026年7月20日
    00

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

自6.2开始主题新增页头通知功能,购买用户可免费升级到最新版体验