Mistral Large 4 的 SVG 生成对比测试
Simon Willison 用同一提示词测试 Claude Opus 5.5、GPT-6.1-sol、Gemini-3.8 Flash 和 mistral/mistral-large-4 生成 SVG 的表现。提示词要求生成“穿渔网袜、在火星上乱穿马路的犰狳”,并提到各模型使用默认推理级别。
Simon Willison 用同一提示词测试 Claude Opus 5.5、GPT-6.1-sol、Gemini-3.8 Flash 和 mistral/mistral-large-4 生成 SVG 的表现。提示词要求生成“穿渔网袜、在火星上乱穿马路的犰狳”,并提到各模型使用默认推理级别。
Google 发布开源模型 EmbeddingGemma 2,可将文本、图像、视频、音频和代码转换为数值向量,用于相似内容查找和比较。该模型有 740 million 参数,Google 称其在多模态嵌入基准上超过规模最高达两倍的竞品,并在 Massive Text Embedding Benchmark (Code) 上得分 78.68,高于前代的 68.76。
Google 推出新的 SynthID 网站,任何人都可验证图片、视频或音频是否由 AI 生成。该工具此前在 Google I/O last year 向部分记者、媒体从业者和研究人员开放测试,现在支持多种图片、视频和音频格式;Nano Banana、Veo、Lyria、Gemini、Flow、ProducerAI 和 Vids 生成的媒体都会使用 SynthID 水印。
Tech星球梳理称,刘大一恒、陈宇森、罗福莉、周畅、姚顺雨等90后正在接手国产大模型关键岗位,分别覆盖Qwen、千问办公、MiMo、字节多模态和腾讯大语言模型及AI Infra。文章列举了他们在开源模型、多模态生成、AI Agent、基础模型和办公智能体商业化中的履历与近期成绩。作者认为,职位交接已经发生,但这些团队仍要面对能力上限、成本约束、商业化落地、组织整合和持续追赶等考验。
三名 Axiom 工程师让 OpenAI GPT-6 Astra 通过车载摄像头和转向系统控制一辆 2024 Toyota Corolla,驶向 In-N-Out 的取餐窗口,安全驾驶员全程准备刹车。
推荐理由:文章用实测案例和 DrivingBench 数据,呈现通用模型物理推理能力进入真实场景后的边界。
OpenAI 将随 GPT-6 推出 ChatGPT 新界面 Intelligent UI,在对话中加入更多可交互视觉元素。该界面可生成可点击按钮、定制计算器、交互式图表、可编辑图形等内容,用于食谱、旅行规划、学习抽象概念等场景。Intelligent UI 将面向 Pro、Plus、Business 和 Enterprise 用户全球推出,免费和低价 Go 层级用户将在 Thursday 获得。
Google 已向公众开放 SynthID Detector,任何人都可以检查图片、视频或音频文件是否由 Google 的 AI 或其合作伙伴创建。该工具可识别 Gemini、Veo、Lyria 等模型内容中的不可见水印,支持 JPG、PNG、MP4 和 MP3,但只能标记带有 SynthID 水印的内容。
Google 推出 Playground,这是一个面向美国成年用户的浏览器 AI 平台,可仅用文本输入创建游戏且无需编码。用户能通过与 AI 往返对话调整规则、物理效果、角色和环境,完成后可通过链接分享或发布到公共图库;平台运行在 Google 的 Gemini、Nano Banana 和 Lyria 模型上。
Google 宣布 SynthID 检测器现在支持所有合作伙伴的水印,并在新的 SynthID.com 网站上面向任何人开放使用。SynthID 是编码在 AI 生成图像、视频像素和 AI 音频波形中的不可见信号,Google 称 Gemini 已在超过 180 billion 张图像和视频以及 240,000 年音频中集成 SynthID。
Meshy 入选 a16z 首份“消费级 AI 应用月收入 Top 50”榜单,位列第 31 名,是榜单唯一 AI 3D 公司。榜单依据 YipitData 追踪的美国消费者银行卡消费数据,Meshy 近期 ARR 已突破 1 亿美元,并于 2026 年 7 月完成近 4 亿美元 B 轮融资。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间。该模型基于 Gemma 4 架构,采用 Apache 2.0 许可,拥有 740 million 参数,支持 8K token 上下文窗口,并可通过 MRL 将输出向量从 768 维截断到 512、256 或 128 维。
推荐理由:原文给出参数规模、上下文窗口和端侧内存数据,可用于评估多模态嵌入在本地检索场景中的适配性。
Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。
推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。
Google DeepMind 宣布 Gemini 4 Argon,这一前沿模型将先通过 Fairwind Program 向一组受信任的网络防御者推出,并逐步扩大访问。
推荐理由:原文给出发布节奏、价格和多项基准结果,可用于了解 Google 对高能力模型分阶段开放的安排。
Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。
推荐理由:原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。
Microsoft Research Asia – Singapore 开设一年来,已扩大团队、深化本地合作,并围绕前沿 AI 的现实应用推进研究。其实验室聚焦下一代 AI 模型与智能体系统、面向行业的 AI、AI-native 研究实践、生态与人才发展,已在医疗、金融、教育和技术等领域开展合作。Microsoft 称该实验室连接其前沿 AI 研究与新加坡高校、政府和产业生态。
Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。
推荐理由:文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的对话 AI 带来近实时视觉形象,并已在 Gemini Enterprise 提供。
推荐理由:原文给出实时视频形象、多语言同步和异步工具调用,便于评估企业对话智能体的交互变化。
Google Research 分享一项研究实验,允许教育者创建定制、交互式、带引导的教育模拟,利用为学习优化的 generative user interfaces(GenUI)动态生成学习交互内容。
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,用于近实时推理、语音智能体和更自然的 AI 对话。
推荐理由:原文同时给出语音模型能力、评测结果和开放入口,便于判断其在语音智能体中的适用场景。
BAIR 庆祝 2026 届 Ph.D. 毕业生,他们的研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成建模、AI 安全、人机交互、AI for science and healthcare 等领域。毕业生将前往高校任教或从事博士后研究、加入产业研究实验室,或创办自己的初创公司。
Berkeley AI Research 提出一种基于互信息直接评估和优化成像系统的框架,只用含噪测量和噪声模型衡量测量区分物体的能力。其 NeurIPS 2025 论文显示,该信息指标可在彩色摄影、射电天文学、无透镜成像和显微成像中预测系统表现,优化设计可匹配 SOTA 端到端方法,同时需要更少内存和计算且无需任务特定解码器。