Kimi 发布视觉感知基准 PerceptionBench

Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。

Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。

信息来源:X:Kimi.ai (@Kimi_Moonshot)

转载请注明出处:https://www.ysthink.site/4422/
(0)
的头像
上一页 1天前
下一页 1天前

相关推荐

  • 开源模型季度盘点:Kimi K3、Qwen 3.8、WAIC 演讲、知识蒸馏与开源闭源差距

    Nathan Lambert 与 Florian Brand 在播客中盘点开源模型最新动态。Kimi K3 发布后,中美 AI 地缘政治、开源与闭源模型的经济性、前沿安全等问题加速演进。Qwen 宣布下一代大模型将开源权重,中国厂商在开源策略上持续加码。讨论还涉及开源模型与闭源前沿的性能差距、知识蒸馏争议,以及后训练对特定任务的价值。

    AI资讯 6天前
    00
  • 从提示词到任务:多模态交互单元提升AI智能体效率

    DAIR.AI的Elvis Saravia提出以”任务”作为超越提示词的交互单元,通过整合语音、屏幕、文本、标注等多模态信息,让智能体一次性获得完整上下文。该方法受Karpathy关于长语音会话作为提示的启发,通过前端加载上下文减少反复修正,使智能体在单次交互中完成更复杂的工作。

    AI资讯 6天前
    00
  • 浪费20亿Token后,我开源了帮Agent定义目标的Leader.skill

    作者开源了Leader.skill,用于将模糊的人类需求转化为Agent可独立执行数小时的目标任务书。该Skill基于”目标七问”方法论,涵盖目的、完成态、反作弊、边界等维度,并推荐用Claude Fable 5或Kimi K3规划目标,再交由GPT-5.6 Sol或GLM-5.2等模型长程执行。项目已开源。

    AI资讯 2天前
    00
  • Kimi K3 开源分布式智能体环境 AgentENV

    我们与 kvcache-ai 合作开源了 AgentENV。

    AgentENV 是一个用于大规模运行智能体环境的分布式系统。其组件为 Kimi K3 的智能体强化学习训练提供支持,具备快速快照、恢复和分支功能,适用于大规模并行智能体工作流。

    在 GitHub 上探索:http://github.com/kvcache-ai/AgentEnv

    AI资讯 1天前
    00
  • xAI Grok Build CLI 网络流量分析:上传仓库全部文件及 git 历史

    对 xAI 官方 Grok Build 编码 CLI(grok 0.2.93)的网络流量分析显示,该工具在消费者登录后会向 xAI 发送三类数据:一是它读取的文件内容(包括 .env 密钥文件)以明文形式通过 POST /v1/responses 传输,并同时打包成 session_state 存档通过 POST /v1/storage 上传并获 HTTP 200 确认;二是整个仓库的全部文件内容及 git 历史,独立于 AI 智能体实际读取的文件–即使提示”不要读取任何文件”,Grok 仍将整个仓库作为 git bundle 上传至 Google Cloud Storage 的 grok-code-session-traces 存储桶;三是该上传机制默认开启,且关闭”改进模型”设置不会禁用(/v1/settings 仍返回 trace_upload_enabled: true)。在 12 GB 仓库测试中,/v1/storage 传输了 5.10 GiB 数据,而模型对话通道仅传输 192 KB,比例约 27,800 倍。分析未证明 xAI 使用这些数据进行训练,但证实了数据被传输、接收并存储。

    AI资讯 2026年7月12日
    00

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

自6.2开始主题新增页头通知功能,购买用户可免费升级到最新版体验