xAI 发布 Grok 4.6,强化长时运行智能体能力
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频。
微软 AI CEO Mustafa Suleyman 宣布首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线,标志微软继续补齐自研基础模型能力。
Google 将 Gemini 3.7 Flash 的价格下调约一半,同时强调该模型在部分商业工作流与开发者场景中的表现领先 Claude,显示主流模型厂商正继续通过价格与能力组合争夺企业客户。
OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍。
Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,任务可在多端应用间无缝切换。
SGLang 与 Miles 在发布首日即支持 Qwen3.8-2.4T-A95B,这是 Qwen 最大的开源模型,总参数 2.4T,每 token 激活 95B,采用混合注意力架构。
法律 AI 公司 DeepJudge 推出开放协议,用于在不同 AI 产品之间安全传递用户身份与上下文。Harvey、Thomson Reuters 等法律科技厂商参与,反映垂直行业开始建设跨工具智能体协作标准。
WhatsApp 推出可选功能 Scam Alert,通过端到端加密保护下在设备端运行机器学习模型识别潜在诈骗消息,消息内容不会离开设备或自动上报,并邀请安全研究社区参与测试。
Claude Code v2.1.229 新增远程会话恢复、自托管 runner 服务器端 hook 与插件市场命令源,并修复长响应流式输出、窄终端渲染、Windows 扩展路径等问题。
面向医学研究者的网站 Research Gold 宣称服务“100%由人类撰写、绝不使用AI”,但调查发现审稿人系 AI 生成,部分真实方法学家的身份和照片未经许可被挪用。
RingCentral 通过全员发放 ChatGPT Work 和 Codex,推动从工程到运营的 AI 原生开发,其 AI-Native Challenge 让数千名员工交付可运行项目。
Thrive Holdings 获得 20 亿美元融资、估值升至 120 亿美元,计划继续收购服务型企业并用 AI 改造运营流程,显示资本市场仍在押注“AI + 传统服务业整合”。
Google 等科技公司宣布与教师组织合作,为教师提供免费的 AI 培训、备课与行政流程辅助资源,生成式 AI 正从企业办公与开发工具扩展到教育基础设施层面。
Google Research 提出知识画像框架,发现前沿 LLM 的事实编码接近饱和,但回忆能力不足,多数事实错误源于“丢钥匙”而非“空货架”,并推出 WikiProfile 基准。
Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。
文章给出零基础用户半天上手 AI 的 12 步流程:准备电脑、订阅 ChatGPT、安装 Codex 或 WorkBuddy、用语音输入法交代背景痛点需求,并沉淀为可复用 Skill。
DeepSeek V4 Pro 正式版与 Grok 4.6 在 2 小时内先后发布,均为 1.6T/1.5T 参数模型,被认为逼近 Claude Fable 5 体验。
AutoGPT 维护者将指令放在 AGENTS.md 和技能文件中,并通过 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等机制,将智能体提交从不可用变为可控。
Nathan Lambert 反思长文非虚构写作中 LLM 进展相对停滞:模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,阻碍模型自主解决开放科学问题。
OpenRouter 发布工具调用指南,展示如何用同一套代码在 Claude、GPT 和开源权重模型间切换,仅需更改模型字符串,并提供 cURL、Python 与 JavaScript 示例。
AI 智能体是在大语言模型循环中自主运行的系统,通过反复调用模型、观察结果并调整下一步行动完成复杂任务。工作流保证确定性,智能体提供灵活性。
OpenAI 研究揭示企业采用智能体 AI 的方式,以及前沿企业如何在 AI 应用上拉开差距。企业正通过 ChatGPT 和 Codex 将 AI 从辅助转向执行。