HYPIC:小红书联合北大、上交提出首个混合注意力大模型位置无关缓存系统

HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。

HYPIC 在混合注意力大模型上实现了位置无关缓存,将首 token 延迟平均降低 3.25 倍。在 4 个生产级模型上,同 SLO 下可持续 QPS 提升 1.66 倍,任务质量与完全重算仅相差 1.71 分。

信息来源:公众号:小红书技术(dots.llm)

转载请注明出处:https://www.ysthink.site/4259/
(0)
的头像
上一页 2026年7月16日
下一页 2026年7月16日

相关推荐

  • Anthropic 推出 Claude for Teachers

    Anthropic 发布 Claude for Teachers,为美国认证的 K-12 教师免费提供高级 Claude 功能、教学技能库及对接全美 50 州学术标准的课程资源。该工具连接 Learning Commons,可调用 OpenSciEd、IM v.360 等课程资源,并集成 ASSISTments、Brisk Teaching、Canva Education 等第三方工具。教师可基于高质量教材规划课程、为不同水平学生差异化教学,还能通过 Claude Code 和 Cowork 自动分析班级数据、安排重复任务。教师数据不用于模型训练,学生信息受 FERPA 合规的 K-12 数据处理附录保护。Anthropic 同时发布与 Teach for America 及美国教师联合会共创的 AI 素养课程。

    AI资讯 2026年7月14日
    00
  • 蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型

    蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。

    AI资讯 2026年7月11日
    00
  • Andrew Ng 创办 LearnVector,用 AI 实现一对一学习

    Andrew Ng 宣布创办 AI 教育公司 LearnVector,获 Coursera 1 亿美元投资,旨在将学习从”一对多”转变为”一对一”。LearnVector 将利用 AI 为每位学习者定制学习路径,而非提供无约束的聊天机器人–研究表明后者会损害学习效果。平台将结合 Coursera 的权威课程库,提供准确、可信任的个性化学习体验。

    AI资讯 8小时前
    00
  • Claude Code 新增 MCP 连接器调用功能

    Claude Code 的 artifacts 现在可以调用 MCP 连接器,让你构建能够按需为每位查看者获取信息并执行操作的仪表盘和应用。

    适用于 Pro、Max、Team 和 Enterprise 计划。不适用于公开共享的 artifacts。

    AI资讯 2026年7月16日
    00
  • LLM cliché highlighter:一款识别AI写作套话的检测工具

    Simon Willison 用 Fable 5 开发了一款 LLM cliché highlighter 应用,用于高亮 LLM 生成文本中常见的十种套话模式,例如”no fluff, no filler, no jargon”这类陈词滥调。该工具旨在帮助读者快速识别并过滤掉充斥在文章中的 AI 写作风格化表达。

    AI资讯 2026年7月17日
    00

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

自6.2开始主题新增页头通知功能,购买用户可免费升级到最新版体验