实测Qwen-Image-3.0:19大场景挑战GPT Image2,中文长文本与多图融合表现亮眼

Qwen-Image-3.0上线,支持最高4.5k token输入、12种语言、20多种字体,以及多图融合、图中图和图片编辑。实测显示,其在中文长文本生成、多语言混合排版、UI设计、多图融合与图片编辑等19个场景中均能稳定输出,文字不崩且信息对应准确,图片质量已能与GPT Image2媲美。该模型在国内可直接使用,速度快且价格不贵。

Qwen-Image-3.0上线,支持最高4.5k token输入、12种语言、20多种字体,以及多图融合、图中图和图片编辑。实测显示,其在中文长文本生成、多语言混合排版、UI设计、多图融合与图片编辑等19个场景中均能稳定输出,文字不崩且信息对应准确,图片质量已能与GPT Image2媲美。该模型在国内可直接使用,速度快且价格不贵。

信息来源:公众号:卡尔的AI沃茨

转载请注明出处:https://www.ysthink.site/4360/
(0)
的头像
上一页 6天前
下一页 6天前

相关推荐

  • NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型

    NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。

    AI资讯 2026年7月17日
    00
  • 微软 MagenticLite 模型全面开源

    MagenticLite 的模型现已完全开源。

    此前在 Microsoft Foundry 上提供的 MagenticBrain 和 Fara 1.5,现已在 Hugging Face 上开放权重。

    该应用、测试工具以及堆栈中的每个模型现已全部开放。

    AI资讯 6天前
    00
  • OpenAI 推出两款新转录模型 API

    我们在 API 中引入了两种新的转录模型:

    • GPT-Live-Transcribe:专为低延迟实时转录而构建。
    • GPT-Transcribe:针对已完成音频文件和批量工作负载的异步转录进行了优化。

    两种模型都能更好地理解上下文,并在跨口音和语言的实际音频上提供更准确的转录,包括短句、数字、专业术语以及背景噪音较大的语音。

    AI资讯 8小时前
    00
  • OpenRouter 上线 Gemini 3.6 Flash 与 3.5 Flash-Lite

    今日在 OpenRouter 上线:Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite!
    两者均为其模型系列的重大更新,具备高吞吐量(150+ tok/s),适用于智能体场景,从高效 token 的编码与知识工作,到低延迟、高并发的子智能体。
    详情如下 🧵

    AI资讯 2026年7月22日
    00
  • ChatGPT 向美国用户推出健康功能

    OpenAI 宣布向美国用户推出 ChatGPT 健康功能,支持安全连接 Apple Health 及受支持的医疗记录。每周有 3 亿用户使用 ChatGPT 进行健康咨询,新功能可让 ChatGPT 理解个人健康上下文,追踪变化并提供更个性化的帮助。

    AI资讯 5天前
    00

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

自6.2开始主题新增页头通知功能,购买用户可免费升级到最新版体验