腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能

腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。

腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。

信息来源:公众号:腾讯混元

转载请注明出处:https://www.ysthink.site/4291/
(0)
的头像
上一页 2026年7月14日
下一页 2026年7月14日

相关推荐

  • OpenAI 推出两款新转录模型 API

    我们在 API 中引入了两种新的转录模型:

    • GPT-Live-Transcribe:专为低延迟实时转录而构建。
    • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。

    两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音。

    AI资讯 8小时前
    00
  • ChatGPT 桌面版上线语音控制多智能体

    ChatGPT 语音功能现已登陆桌面应用。

    只需使用语音,即可控制你的电脑,并指挥在 ChatGPT Work 或 Codex 中运行的多个智能体。

    该功能由 GPT-Live 驱动,因此它能够同时在该应用中说话、聆听并协调工作。

    今日起,面向 macOS 和 Windows 平台的 Plus、Pro、Business、Edu 及 Enterprise 计划用户全球推送。

    AI资讯 5天前
    00
  • 不会代码也能做产品:一份从0开始的Vibe Coding保姆级教程

    本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen等)从零开发并上线产品的完整流程。核心步骤包括购买Coding Plan、下载官方Agent编程产品、注册域名与服务器并同步做ICP备案,然后通过Agent的Plan模式描述需求并让AI自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。

    AI资讯 2026年7月20日
    00
  • GitHub Copilot 发布”Harness”工作流:用单一工具完成原型、规划、实现与代码审查

    GitHub Copilot 推出”Harness”工作流,让开发者通过单一 AI 工具完成从原型设计、规划、实现到代码审查的完整软件开发流程,无需追逐多种新 AI 工具。该工作流强调实用性与集成性,旨在减少工具切换带来的效率损耗。

    AI资讯 1天前
    00
  • 开源模型季度盘点:Kimi K3、Qwen 3.8、WAIC 演讲、知识蒸馏与开源闭源差距

    Nathan Lambert 与 Florian Brand 在播客中盘点开源模型最新动态。Kimi K3 发布后,中美 AI 地缘政治、开源与闭源模型的经济性、前沿安全等问题加速演进。Qwen 宣布下一代大模型将开源权重,中国厂商在开源策略上持续加码。讨论还涉及开源模型与闭源前沿的性能差距、知识蒸馏争议,以及后训练对特定任务的价值。

    AI资讯 6天前
    00

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

自6.2开始主题新增页头通知功能,购买用户可免费升级到最新版体验