研究人员让 OpenAI GPT-6 Astra 驾驶 Toyota Corolla 去 In-N-Out
三名 Axiom 工程师让 OpenAI GPT-6 Astra 通过车载摄像头和转向系统控制一辆 2024 Toyota Corolla,驶向 In-N-Out 的取餐窗口,安全驾驶员全程准备刹车。
推荐理由:文章用实测案例和 DrivingBench 数据,呈现通用模型物理推理能力进入真实场景后的边界。
技术方向
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
8 条精选近 30 天 8 条共收录 21 条
三名 Axiom 工程师让 OpenAI GPT-6 Astra 通过车载摄像头和转向系统控制一辆 2024 Toyota Corolla,驶向 In-N-Out 的取餐窗口,安全驾驶员全程准备刹车。
推荐理由:文章用实测案例和 DrivingBench 数据,呈现通用模型物理推理能力进入真实场景后的边界。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间。该模型基于 Gemma 4 架构,采用 Apache 2.0 许可,拥有 740 million 参数,支持 8K token 上下文窗口,并可通过 MRL 将输出向量从 768 维截断到 512、256 或 128 维。
推荐理由:原文给出参数规模、上下文窗口和端侧内存数据,可用于评估多模态嵌入在本地检索场景中的适配性。
Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。
推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。
Google DeepMind 宣布 Gemini 4 Argon,这一前沿模型将先通过 Fairwind Program 向一组受信任的网络防御者推出,并逐步扩大访问。
推荐理由:原文给出发布节奏、价格和多项基准结果,可用于了解 Google 对高能力模型分阶段开放的安排。
Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。
推荐理由:原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。
Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。
推荐理由:文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的对话 AI 带来近实时视觉形象,并已在 Gemini Enterprise 提供。
推荐理由:原文给出实时视频形象、多语言同步和异步工具调用,便于评估企业对话智能体的交互变化。
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,用于近实时推理、语音智能体和更自然的 AI 对话。
推荐理由:原文同时给出语音模型能力、评测结果和开放入口,便于判断其在语音智能体中的适用场景。