跳到正文
  1. Wired · AI76

    研究人员让 OpenAI GPT-6 Astra 驾驶 Toyota Corolla 去 In-N-Out

    三名 Axiom 工程师让 OpenAI GPT-6 Astra 通过车载摄像头和转向系统控制一辆 2024 Toyota Corolla,驶向 In-N-Out 的取餐窗口,安全驾驶员全程准备刹车。

    推荐理由:文章用实测案例和 DrivingBench 数据,呈现通用模型物理推理能力进入真实场景后的边界。

  2. TechCrunch · AI85

    OpenAI 随 GPT-6 推出 ChatGPT 新界面 Intelligent UI

    OpenAI 将随 GPT-6 推出 ChatGPT 新界面 Intelligent UI,在对话中加入更多可交互视觉元素。该界面可生成可点击按钮、定制计算器、交互式图表、可编辑图形等内容,用于食谱、旅行规划、学习抽象概念等场景。Intelligent UI 将面向 Pro、Plus、Business 和 Enterprise 用户全球推出,免费和低价 Go 层级用户将在 Thursday 获得。

    推荐理由:原文展示了 ChatGPT 从文本回答转向可交互视觉元素的界面变化及开放范围。

  1. Google DeepMind75

    Google DeepMind 发布 EmbeddingGemma 2 开放轻量多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间。该模型基于 Gemma 4 架构,采用 Apache 2.0 许可,拥有 740 million 参数,支持 8K token 上下文窗口,并可通过 MRL 将输出向量从 768 维截断到 512、256 或 128 维。

    推荐理由:原文给出参数规模、上下文窗口和端侧内存数据,可用于评估多模态嵌入在本地检索场景中的适配性。

  1. Mistral AI84

    Mistral AI 发布 Mistral Large 4 公共预览版

    Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。

    推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。

  1. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 宣布 Gemini 4 Argon,这一前沿模型将先通过 Fairwind Program 向一组受信任的网络防御者推出,并逐步扩大访问。

    推荐理由:原文给出发布节奏、价格和多项基准结果,可用于了解 Google 对高能力模型分阶段开放的安排。

  1. Microsoft Research70

    Microsoft Research 介绍面向复杂生物学的 AI 研究系统 Quine

    Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。

    推荐理由:原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。

  1. Google Research71

    Google Research 提出用于连贯长视频生成的 AI video co-director 框架

    Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。

    推荐理由:文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。

  2. Google DeepMind73

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的对话 AI 带来近实时视觉形象,并已在 Gemini Enterprise 提供。

    推荐理由:原文给出实时视频形象、多语言同步和异步工具调用,便于评估企业对话智能体的交互变化。

  1. Google DeepMind86

    Google DeepMind 推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking

    Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,用于近实时推理、语音智能体和更自然的 AI 对话。

    推荐理由:原文同时给出语音模型能力、评测结果和开放入口,便于判断其在语音智能体中的适用场景。

已经到底了