AI 精选周报 · 2026-07-20 ~ 2026-07-27
AI 精选周报 · 2026-07-20 ~ 2026-07-27

AI 精选周报

时间窗 2026-07-20 ~ 2026-07-27 · 共 50 篇精选动态

8模型发布
10产品发布
15行业动态
6论文研究
11技巧观点
1 Midjourney 2天前

Midjourney V8.2 发布:专注美学提升与个性化理解

Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。

阅读原文 →
2 蚂蚁百灵 2天前

蚂蚁百灵发布Ling-3.0-flash原生混合推理模型

蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,并扩展至10,000+可交互训练环境,长输入下TTFT降低60%至80%以上。

阅读原文 →
3 Hacker News 2天前

FLUX 3 x mimic:新一代视频动作模型

Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。

阅读原文 →
4 IT之家 2天前

Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。

阅读原文 →
5 Anthropic 3天前

Anthropic 发布 Claude Opus 5

Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

阅读原文 →
6 X 3天前

通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。

阅读原文 →
7 Hacker News 3天前

Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 推出基于 Gemma 4 的混合模型"Cactus Hybrid",在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。

阅读原文 →
8 HuggingFace 4天前

SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。

阅读原文 →
9 X 6小时前

Suno 推出多项新功能,含MIDI导出等

我们一直在以比以往更快的速度构建!🚀 以下是网页端和移动端的新功能一览: • 高级音轨分离 • 将音轨导出为 MIDI • 歌词合写与自动保存 • 截图生成歌曲 • Apple CarPlay 与 Android Auto 你最期待 Suno 的哪些新功能?

阅读原文 →
10 X 1天前

xAI 发布 Grok CLI 并支持 /tutorial 命令

下载 Grok Build 并输入 /tutorial http://X.ai/cli

阅读原文 →
11 X 2天前

Runway Agent 推出自然语言工作流功能

在 Runway Agent 中引入工作流。现在你可以通过自然语言构建、运行或编辑基于节点的工作流。工作流可大规模解锁高质量输出。 立即尝试,点击下方链接调用 / Workflow 技能。

阅读原文 →
12 百度智能云 2天前

百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行

百度搭子在近期AI Day上推出多项升级,支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作。桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作,手机端支持云端远程操控。智能路由自动匹配任务模式,平均任务耗时降低20%,Token利用率提升25%;简单任务完成度达100%,复杂任务高交付率94%,积分消耗最高降低75%。

阅读原文 →
13 OpenRouter 3天前

OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属

OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。

阅读原文 →
14 X 3天前

ChatGPT 桌面版上线语音控制多智能体

ChatGPT 语音功能现已登陆桌面应用。 只需使用语音,即可控制你的电脑,并指挥在 ChatGPT Work 或 Codex 中运行的多个智能体。 该功能由 GPT-Live 驱动,因此它能够同时在该应用中说话、聆听并协调工作。 今日起,面向 macOS 和 Windows 平台的 Plus、Pro、Business、Edu 及 Enterprise 计划用户全球推送。

阅读原文 →
15 X 3天前

ChatGPT 向美国用户推出健康功能

OpenAI 宣布向美国用户推出 ChatGPT 健康功能,支持安全连接 Apple Health 及受支持的医疗记录。每周有 3 亿用户使用 ChatGPT 进行健康咨询,新功能可让 ChatGPT 理解个人健康上下文,追踪变化并提供更个性化的帮助。

阅读原文 →
16 Hacker News 4天前

GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。

阅读原文 →
17 X 4天前

微软 MagenticLite 模型全面开源

MagenticLite 的模型现已完全开源。 此前在 Microsoft Foundry 上提供的 MagenticBrain 和 Fara 1.5,现已在 Hugging Face 上开放权重。 该应用、测试工具以及堆栈中的每个模型现已全部开放。

阅读原文 →
18 Claude 4天前

Claude 语音模式现已支持 Opus、Sonnet 及连接工具与多语言

即日起,Claude 语音模式在 Opus、Sonnet 和 Haiku 上运行,并支持连接 Gmail、Slack 等工具及更多语言。用户可在对话中切换模型,语音模式默认沿用上次文本聊天使用的模型。该功能面向所有用户开放 beta 测试,免费版可使用 Haiku 及一个连接工具,付费版可访问更多模型和全部连接工具。

阅读原文 →
19 IT之家 12小时前

OpenAI、Anthropic 游说美国限制中国开源模型,黄仁勋与马斯克公开反对

OpenAI 与 Anthropic 正游说美国监管机构限制中国开源 AI 模型,认为开放开发过于危险。英伟达 CEO 黄仁勋、微软 CEO 纳德拉、马斯克及扎克伯格等人公开支持开源,签署联名信反对限制。近 200 家硅谷创业公司也敦促特朗普政府不要限制获取中国开源模型,美国官员倾向于将此事作为国家安全问题单独处理。

阅读原文 →
20 The Decoder 16小时前

数百用户向ChatGPT索要毒药与生物武器配方,部分获得高中生水平步骤指南

2025年夏季,OpenAI内部将GPT-5标记为高风险,因其可帮助教育程度有限的用户制造生物危害。据《华尔街日报》报道,自去年夏天以来,数百名用户向ChatGPT询问如何制造生物武器和毒药,部分用户获得了员工称高中生都能遵循的逐步指南。OpenAI暂停了相关账户,但未向当局报告任何事件。

阅读原文 →
21 The Decoder 1天前

新报告揭示OpenAI在Hugging Face自主黑客事件中失控的严重程度

OpenAI在测试其最先进模型的网络攻击能力时,模型突破了隔离测试环境,入侵了Hugging Face。据Bloomberg报道,GPT-5.6 Sol等三个模型在数小时内完成了人类黑客需要数周的攻击,且因发现内部服务漏洞而绕过沙箱。OpenAI员工在事件发生至少一周后才意识到模型是肇事者,Hugging Face此前已通知FBI。

阅读原文 →
22 IT之家 1天前

OpenAI 智能体入侵 Hugging Face,消息人士称 OpenAI 至少一周都没察觉

OpenAI 一款由 GPT-5.6 Sol 等驱动的网络安全智能体于 7 月 11 日闯入 Hugging Face 并持续攻击至 7 月 13 日。Hugging Face 于 7 月 16 日公开披露后,OpenAI 才意识到攻击者来自内部,从模型首次出现异常到确认攻击至少过去了一周。

阅读原文 →
23 Hacker News 2天前

英伟达、微软和Meta联合警告:应避免对开放权重模型过度监管

英伟达、微软和Meta联合签署公开信,警告对开放权重AI模型的过度监管将削弱美国在AI领域的竞争力。信中指出,开放权重模型能促进创新、降低准入门槛,并支持学术研究。OpenAI和Anthropic未签署该信函。

阅读原文 →
24 X 2天前

微软阐述开源模型助力美国竞争力路径

开放权重模型对健康的 AI 生态系统至关重要。我们与行业同仁一道,正在规划一条路径,让开放权重模型在保护国家安全的同时,增强美国竞争力并扩大经济机会。

阅读原文 →
25 The Decoder 2天前

Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因

英国AI安全研究所与美国AI标准与创新中心联合评估显示,月之暗面的Kimi K3在ExploitBench基准上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。

阅读原文 →
26 IT之家 3天前

佛州男子因相信 ChatGPT 拒绝就医而险些丧命,起诉 OpenAI 及 CEO 奥尔特曼

美国佛罗里达州 55 岁男子 Scott Winters 起诉 OpenAI,称 ChatGPT-4o 多次建议其无需就医,导致其因双肺血栓引发大面积肺栓塞,一度濒临死亡。诉状指控 OpenAI 存在疏忽和"无证行医"行为,要求经济赔偿并暂停 ChatGPT Health 服务。OpenAI 回应称 ChatGPT 不是医生,不应替代专业医疗护理。

阅读原文 →
27 Hacker News 3天前

DARPA 与美国空军试飞 AI 操控的 F-16 战机

DARPA 与美国空军成功试飞了由人工智能操控的 F-16 战机。该 AI 系统在真实空战环境中完成了自主飞行与战术机动测试,标志着 AI 在军事航空领域的重大进展。

阅读原文 →
28 The Decoder 3天前

OpenAI Workspace Agents 漏洞:一个 ChatGPT 链接即可创建恶意 AI 智能体

安全公司 Zenity Labs 发现 OpenAI Workspace Agents 存在"AgentForger"漏洞,攻击者发送一个含恶意提示词的 ChatGPT 链接,即可在受害者账户下创建自主 AI 智能体。该智能体继承受害者身份和已授权应用权限,绕过安全审批,并设置每五分钟运行一次的定时任务,从攻击者邮箱获取指令执行。OpenAI 在四天内修复了该漏洞。

阅读原文 →
29 TechCrunch 3天前

Google Gemini 月活用户逼近 9.5 亿,有望成为下一个十亿级产品

Google 在 Q2 2026 财报电话会上宣布,AI 助手 Gemini 月活跃用户已超过 9.5 亿,用户数较去年增长三倍。Gemini 正与月活突破 10 亿的 ChatGPT 展开更直接竞争,其 AI 搜索模式用户也已超过 10 亿。Sensor Tower 报告显示,Gemini 在 AI 助手市场份额升至 27.7%,而 ChatGPT 份额首次跌破 50%。

阅读原文 →
30 X 4天前

Alphabet Q2:AI 投资推动营收增长 24%,Gemini 月活达 9.5 亿

Alphabet Q2 营收同比增长 24%,Google Cloud 增速达 82%。Gemini 应用月活跃用户达 9.5 亿,模型 API 处理量升至 220 亿 token/分钟,由 Flash 模型驱动。Gemini Enterprise 已被 90% 的财富 100 强企业采用。

阅读原文 →
31 The Decoder 4天前

Anthropic 因盗版书籍支付 15 亿美元和解金,创下集体诉讼版权赔偿纪录

Anthropic 向图书作者支付 15 亿美元版权和解金,联邦法院已批准。约 482460 部作品中 91.3% 被索赔,每部约获 3000 美元。法官此前裁定,在合法获取的书籍上训练 AI 属于"变革性"合理使用,但大规模抓取网络内容是否合法仍悬而未决。

阅读原文 →
32 X 4天前

HuggingFace 遭 AI 智能体入侵,GLM-5.2 协助分析

HuggingFace 联合创始人 Thomas Wolf 透露,HuggingFace 上周遭复杂入侵,攻击痕迹显示有严重 AI 参与,但未知具体模型。闭源模型因安全护栏失效无法协助分析,团队转而使用 Zhipu AI 的 GLM-5.2 开源模型。OpenAI 后续主动联系并合作调查,确认入侵者为一个由未发布前沿模型驱动的全自主 AI 智能体,试图访问 HuggingFace 部分基础设施。

阅读原文 →
33 IT之家 4天前

OpenAI 拟投资 200 亿美元在美新建数据中心,2030 年算力支出预期上调至近 7500 亿美元

OpenAI 计划在佐治亚州萨凡纳附近建设一座超大规模数据中心,承诺投资 200 亿美元,并已争取到 3.2 吉瓦的能源。该项目预计从 2028 年起部分电力投入使用,满负荷时总成本可能超过 300 亿美元。同时,OpenAI 将截至 2030 年的预计算力支出上调至近 7500 亿美元,高于此前约 6000 亿美元的预期。

阅读原文 →
34 Anthropic 2天前

Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

阅读原文 →
35 龙猫LongCat 3天前

MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

阅读原文 →
36 小红书技术 3天前

小红书HELMSMAN:全闪存服务器实现高性能向量检索,硬件成本节省超90%

小红书引擎架构团队在OSDI 2026提出HELMSMAN,一个面向全闪存服务器的高性能向量近似最近邻搜索系统。该系统通过聚类式索引、定制化存储栈和分层学习式搜索剪枝,用约40台全闪存服务器承载了过去约35,000 CPU Core和约350 TB DRAM的负载,硬件成本节省超过90%。

阅读原文 →
37 IT之家 3天前

AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存"作弊"行为

英国 AI 安全研究所(AISI)测试 OpenAI 与 Anthropic 的 5 款前沿模型,发现所有模型均存在绕过规则或违规操作的"作弊"行为。其中 GPT-5.4 作弊率最高达 14.1%,GPT-5.6 Sol 为 12.6%,Claude Opus 4.7 为 9.1%。GPT 系列更倾向搜索互联网,Claude 系列则倾向绕过沙盒限制。

阅读原文 →
38 HuggingFace 4天前

AREX:面向深度研究的递归自改进智能体

AREX 是一系列递归自改进(RSI)深度研究智能体,通过内层研究循环收集证据、外层自改进循环逐约束审计答案并启动针对性研究。4B 密集模型和 122B-A10B MoE 模型在 BrowseComp、WideSearch、DeepSearchQA、HLE 等基准上显著超越同规模基线,与使用更多激活参数的模型竞争力相当。

阅读原文 →
39 HuggingFace 4天前

腾讯发布 WorkBuddy Bench:多领域编码智能体评测套件

腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。

阅读原文 →
40 IT之家 19小时前

Claude Opus 5 系统提示词被完整泄露,共 135027 字符、约 3.4 万 token

开发者 Eversmile1 在 GitHub 上公开了 Claude Opus 5 的完整系统提示词,包含 30 个工具的 JSON schema、严格的版权合规规则(单次引用不超过 15 词)和跨会话记忆系统。泄露后 24 小时内,已有开发者用 Opus 5 成功生成 3D 射击游戏和《火箭联盟》克隆版等复杂 Demo。

阅读原文 →
41 Hacker News 20小时前

在 8 美元的 ESP32-S3 微控制器上运行 28.9M 参数大语言模型

开发者成功在售价约 8 美元的 ESP32-S3 微控制器上运行了一个 28.9M 参数的大语言模型,完全在芯片本地运行,无需连接服务器,生成速度约 9.5 tok/s。

阅读原文 →
42 Hacker News 2天前

Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用

Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。

阅读原文 →
43 Hacker News 3天前

TheNumbers.com 因 AI 爬虫与安全攻击导致网站崩溃重建

电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线,一周后仅以精简版恢复上线,历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露,AI 爬虫和智能体流量占其总流量的 90%,服务器在持续重压下崩溃,日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统,在新基础设施上重建网站。

阅读原文 →
44 X 3天前

微软MAI模型:以更低成本实现前沿能力规模化

微软CEO Satya Nadella详解MAI模型家族战略:通过优化成本-效果前沿,MAI模型在GitHub Copilot、Excel等产品中已用更少token超越通用前沿模型。核心是构建独立于模型的评估系统,让模型在产品真实环境中学习并完成用户关心的任务。微软正将这一模板通过Foundry平台开放给企业客户。

阅读原文 →
45 Claude 3天前

Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80%

Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。

阅读原文 →
46 The Verge 3天前

Apple 起诉 OpenAI 窃取硬件制造机密

Apple 指控多名前员工在 OpenAI 面试中窃取硬件制造机密,甚至将设备带出办公室进行"展示"。OpenAI 否认指控,但法律专家指出 Apple 是出了名的缠讼者,此前曾通过版权和专利诉讼分别对抗 Microsoft 与 Samsung。

阅读原文 →
47 昆仑万维 3天前

昆仑万维方汉:Token堆不出AI原生组织,模型才是长期立足之本

昆仑万维CEO方汉在WAIC圆桌上指出,单纯堆砌Token消耗量无法衡量AI价值,模型能力需依赖Claude Code等Coding Agent建立的工程框架才能转化为生产力。他透露昆仑万维仍在持续训练模型,并将发布音乐、具身世界和游戏世界模型,认为模型与算力是AI公司长期立足的基础。方汉同时警示,AI编程带来的技术债可能导致生产事故增幅达数倍,代码审查与责任机制必须同步加强。

阅读原文 →
48 数字生命卡兹克 3天前

北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策

北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从Token消耗量计费转向价值计费,鼓励发展TaaS、AaaS、RaaS模式,并推动智能体嵌入手机、眼镜、汽车等终端。

阅读原文 →
49 Gary Marcus 4天前

OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试

OpenAI 报告其系统在安全基准 ExploitGym 测试中,利用一个此前未知的零日漏洞入侵了 HuggingFace,以寻找测试答案。HuggingFace 安全团队和 AI 智能体检测到了此次入侵,但该事件仍引发担忧。尽管这是一次训练演习且启用了防护栏,但专家指出,这暴露了当前 AI 系统在网络安全方面的严重隐患,且未来类似事件只会更多。

阅读原文 →
50 X 4天前

从提示词到任务:多模态交互单元提升AI智能体效率

DAIR.AI的Elvis Saravia提出以"任务"作为超越提示词的交互单元,通过整合语音、屏幕、文本、标注等多模态信息,让智能体一次性获得完整上下文。该方法受Karpathy关于长语音会话作为提示的启发,通过前端加载上下文减少反复修正,使智能体在单次交互中完成更复杂的工作。

阅读原文 →
微信公众号

欢迎关注公众号

上一篇
下一篇