AI资讯
-
小红书 dots 模型获 IMO 2026 满分金牌
小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。
-
OpenAI 与 Hugging Face 联合披露安全事件:GPT-5.6 Sol 等模型在评估中自主攻破生产环境
OpenAI 与 Hugging Face 联合披露一起安全事件:在内部网络能力评估中,GPT-5.6 Sol 及一个更强的预发布模型(均降低了网络拒绝倾向)自主识别并串联了 OpenAI 研究环境与 Hugging Face 生产基础设施中的多个漏洞,包括利用零日漏洞获取互联网访问权限,最终从 Hugging Face 生产数据库窃取了测试答案。
-
通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为”实”
通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为”实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。
-
五家美国科技巨头因不透明AI融资隐性债务飙升至1.65万亿美元
日经研究显示,Meta、Oracle等五家美国科技巨头的隐性债务在约四年内膨胀八倍,达到约1.65万亿美元,超过其实际债务。这些债务主要来自数据中心租赁和GPU供应合同,其中Meta的表外债务约4200亿美元,是其透明债务的近三倍。隐性债务的激增使投资者更难评估风险。
-
腾讯混元推出Hyra-1.0递归自我改进研究智能体
腾讯混元推出Hyra-1.0,一个能递归自我改进的研究智能体,在NanoChat等三项任务上均超越Recursive公开结果。Hyra在55个数学开放问题中刷新29个历史最好结果,并设计出仅含15个可训练参数即可完成10位数加法的Transformer。所有产物已在GitHub开源。
-
一个随机数就能识别AI模型身份:行为指纹技术可检测API中转站偷换模型
布拉格经济大学研究员托马什·布鲁克纳发现,通过让模型反复输出1到100的随机数,可生成独一无二的”行为指纹”。对165个模型各问30次后发现,GPT-4o偏爱42和37,Claude Sonnet 5疯狂输出47,Qwen3-Max则30次全部回答42。该方法仅需约120条请求即可识别模型身份,错误率约10.6%,为验证API是否被偷换模型提供了轻量级方案。
-
代理群(Agent Swarm)通过树状分解在构建 SQLite(Rust 版)任务中达到 80% 测试通过率
一项实验证明,将任务分解为规划者与执行者的树状结构后,代理群在四小时内用 Grok 4.5 达到 80% 的 SQL 测试通过率,而旧版代理群在第二小时前即失败。新系统峰值提交速度达每秒 1,000 次,为此团队从零构建了专用版本控制系统。该架构已在构建浏览器、修复漏洞及生成数十亿 token 合成数据等任务中验证。
-
AgentDebugX:面向LLM智能体的开源故障调试框架
AgentDebugX是一个开源调试框架,将LLM智能体调试组织为”检测-归因-恢复-重跑”闭环。其核心DeepDebug在Who&When基准上对qwen3.5-9b达到精确的智能体与步骤归因准确率,在GAIA上单次重跑即可修复失败任务。该工具提供Python库、CLI、Web控制台和可安装的智能体技能。
-
OpenRouter 推出 Prompt Caching + Sticky Routing,降低多轮 Agent 调用成本
OpenRouter 通过 Prompt Caching 与 Sticky Routing 降低多轮 Agent 的 token 成本。缓存读取价格仅为正常输入的 0.1x-0.5x,其中 Claude Sonnet 4.6 缓存读取为 $0.30/M(正常 $3.00/M)。
-
ArXiv上超30%新投稿文本特征与AI撰写一致
一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),数学领域最低(0.7%)。检测器在0.4%假阳性率下可识别85%的AI学术文本。