2026年8月13日 · 周四

AI 资讯速递

精选 24 条今日最重要的 AI 新闻,xAI 发布 Grok 4.6 领衔

数据来源aihot.virxact.com自动聚合生成
头条AI模型产品Agent今日

xAI 发布 Grok 4.6,强化长时运行智能体能力

xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

长时运行智能体视觉与交互增强编码基准前沿
阅读原文
模型与开源
AI模型开源产品今日

阿里开放 Qwen3.8-2.4T-A95B 模型权重

阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。

AI模型产品财经今日

LTX-2.5 模型登场:10 秒 720P 视频仅需 6.8 秒

LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频。

AI模型产品今日

微软首发自研推理模型 MAI-Thinking-1

微软 AI CEO Mustafa Suleyman 宣布首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线,标志微软继续补齐自研基础模型能力。

AI模型产品企业补充

Google 降低 Gemini 3.7 Flash 价格,并宣称在企业工作流上超过 Claude

Google 将 Gemini 3.7 Flash 的价格下调约一半,同时强调该模型在部分商业工作流与开发者场景中的表现领先 Claude,显示主流模型厂商正继续通过价格与能力组合争夺企业客户。

产品与更新
AI模型产品Agent今日

OpenRouter 推出实时网页搜索基准测试

OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍。

AI产品Agent今日

Claude in Chrome 侧边栏升级为 Claude Cowork 会话

Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,任务可在多端应用间无缝切换。

AI模型开源产品今日

SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持

SGLang 与 Miles 在发布首日即支持 Qwen3.8-2.4T-A95B,这是 Qwen 最大的开源模型,总参数 2.4T,每 token 激活 95B,采用混合注意力架构。

AI产品Agent企业补充

DeepJudge 发布 AI 产品间用户与上下文传递开放协议

法律 AI 公司 DeepJudge 推出开放协议,用于在不同 AI 产品之间安全传递用户身份与上下文。Harvey、Thomson Reuters 等法律科技厂商参与,反映垂直行业开始建设跨工具智能体协作标准。

政策与安全
AI安全开源产品今日

WhatsApp 构建端到端加密 Scam Alert 诈骗提醒功能

WhatsApp 推出可选功能 Scam Alert,通过端到端加密保护下在设备端运行机器学习模型识别潜在诈骗消息,消息内容不会离开设备或自动上报,并邀请安全研究社区参与测试。

AI产品芯片安全今日

Claude Code v2.1.229 发布

Claude Code v2.1.229 新增远程会话恢复、自托管 runner 服务器端 hook 与插件市场命令源,并修复长响应流式输出、窄终端渲染、Windows 扩展路径等问题。

行业与资本
AI产品企业研究今日

Research Gold 宣称人类撰写,实则全程由 AI 驱动

面向医学研究者的网站 Research Gold 宣称服务“100%由人类撰写、绝不使用AI”,但调查发现审稿人系 AI 生成,部分真实方法学家的身份和照片未经许可被挪用。

AI产品企业国际今日

RingCentral 用 ChatGPT Work 和 Codex 构建 AI 原生工作流

RingCentral 通过全员发放 ChatGPT Work 和 Codex,推动从工程到运营的 AI 原生开发,其 AI-Native Challenge 让数千名员工交付可运行项目。

AI财经企业补充

Thrive Holdings 完成 20 亿美元融资,估值达 120 亿美元

Thrive Holdings 获得 20 亿美元融资、估值升至 120 亿美元,计划继续收购服务型企业并用 AI 改造运营流程,显示资本市场仍在押注“AI + 传统服务业整合”。

AI产品芯片企业补充

五家主流 AI 公司将与美国教师联盟合作,提供免费 AI 培训资源

Google 等科技公司宣布与教师组织合作,为教师提供免费的 AI 培训、备课与行政流程辅助资源,生成式 AI 正从企业办公与开发工具扩展到教育基础设施层面。

研究与观点
AI模型国际研究今日

Google 研究:Recall 是参数化事实性的瓶颈

Google Research 提出知识画像框架,发现前沿 LLM 的事实编码接近饱和,但回忆能力不足,多数事实错误源于“丢钥匙”而非“空货架”,并推出 WikiProfile 基准。

AI产品国际研究今日

Anthropic 发布工人再培训项目证据综述

Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。

AI模型今日

零基础用户半天上手 AI 的 12 步实操流程

文章给出零基础用户半天上手 AI 的 12 步流程:准备电脑、订阅 ChatGPT、安装 Codex 或 WorkBuddy、用语音输入法交代背景痛点需求,并沉淀为可复用 Skill。

AI模型产品今日

DeepSeek V4 Pro 与 Grok 4.6 同日发布

DeepSeek V4 Pro 正式版与 Grok 4.6 在 2 小时内先后发布,均为 1.6T/1.5T 参数模型,被认为逼近 Claude Fable 5 体验。

AIAgent今日

AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的 PR

AutoGPT 维护者将指令放在 AGENTS.md 和技能文件中,并通过 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等机制,将智能体提交从不可用变为可控。

AI模型今日

我写了一本 AI 教科书——AI 还要多久才能写得更好?

Nathan Lambert 反思长文非虚构写作中 LLM 进展相对停滞:模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,阻碍模型自主解决开放科学问题。

AI模型开源产品今日

OpenRouter 工具调用指南:一次编写循环跨模型运行

OpenRouter 发布工具调用指南,展示如何用同一套代码在 Claude、GPT 和开源权重模型间切换,仅需更改模型字符串,并提供 cURL、Python 与 JavaScript 示例。

AI模型产品Agent今日

LangChain 详解:什么是 AI 智能体?

AI 智能体是在大语言模型循环中自主运行的系统,通过反复调用模型、观察结果并调整下一步行动完成复杂任务。工作流保证确定性,智能体提供灵活性。

AIAgent企业国际今日

OpenAI 研究:企业如何用 ChatGPT 和 Codex 落地智能体 AI

OpenAI 研究揭示企业采用智能体 AI 的方式,以及前沿企业如何在 AI 应用上拉开差距。企业正通过 ChatGPT 和 Codex 将 AI 从辅助转向执行。