Mistral Large 4 的 SVG 生成对比测试
Simon Willison 用同一提示词测试 Claude Opus 5.5、GPT-6.1-sol、Gemini-3.8 Flash 和 mistral/mistral-large-4 生成 SVG 的表现。提示词要求生成“穿渔网袜、在火星上乱穿马路的犰狳”,并提到各模型使用默认推理级别。
Simon Willison 用同一提示词测试 Claude Opus 5.5、GPT-6.1-sol、Gemini-3.8 Flash 和 mistral/mistral-large-4 生成 SVG 的表现。提示词要求生成“穿渔网袜、在火星上乱穿马路的犰狳”,并提到各模型使用默认推理级别。
EmbeddingGemma 2 采用 Apache 2.0 许可证,作者认为嵌入模型不适合只提供闭源、专有、托管版本。嵌入应用常需计算并长期保存成千上万甚至数百万个嵌入向量,若供应商停供模型,用户可能要为重新计算存量向量付费。OpenAI 曾在 2024 年 4 月提出承担用户重新嵌入内容的费用,但作者认为这不能指望所有提供商都会这样做。
OpenAI 发布了 372 个由内部前沿模型生成的数学结果,托管在 GitHub 而非学术期刊,并称每个结果旨在解决开放问题或取得实质进展。这些结果包含主要计算机算法改进和与 Riemann hypothesis 相关的进展,许多证明带有 Lean 形式化,平均每项消耗约三小时的 ChatGPT Pro Thinking compute。
推荐理由:原文呈现了 AI 生成数学证明从产出到审查的流程变化,以及数学界对理解价值的分歧。
Musubi 周二宣布发布用于实时内容审核的轻量级决策模型 PolicyLM-1.7B,并以 open weights 形式开放。该模型可读取用普通英语写成的内容政策,并在 under 50 milliseconds 内应用到消息上;它被设计为在成本和速度上接近多数社交平台使用的 AI 分类器,同时利用现代 LLM 的灵活性处理复杂政策。
TechCrunch Disrupt 2026 将在 6 天后于旧金山 Moscone West 举行,预计吸引 10,000+ 名全球创业和科技生态参与者。活动设有 200+ 场会议、6 个舞台和 250+ 位科技领袖演讲,主题涵盖 AI、融资、fintech、机器人等。开幕前购票最高省 $100,第二张符合条件通行证可享 50% off,被裁员者可购买 $75 Expo+ Pass。
OpenAI Dots 产品负责人 Alexander Embiricos 将在 TechCrunch Disrupt 2026 讨论这款常驻个人 AI 智能体。Dots 拥有自己的云端计算机,可连接日常应用,并在后台持续推进目标;活动将于 October 13-15 在 San Francisco 的 Moscone West 举行。
OpenAI 发布了一批由未发布前沿模型生成的数学手稿,共 722 篇,覆盖 372 个相关结果族,据称包含“数百个”开放问题的解法。发布内容包括部分模型推理摘要、所用 compute 估计和尝试问题数量统计,OpenAI 称“平均结果”相当于 3 小时 ChatGPT Pro thinking。
同一新闻,精选展示《OpenAI 在 GitHub 发布 372 个 AI 生成数学证明》
Common Sense Media 称 OpenAI 的 ChatGPT for Teens 是“不可接受的风险”,认为其青少年保护措施没有达到公司承诺。该机构评估称,ChatGPT 在应发送家长提醒时没有提醒,危机情境下没有提供合适帮助,并且仍会帮孩子做作业。
硅谷101访谈Scale AI后训练与评测研究负责人何允中、伯克利博士后孙一铀,讨论AI数据行业从人工标注转向rubric、RL环境和智能体数据。对话提到AfterQuery估值从今年4月A轮的3亿美元升至9月新一轮融资后的32亿美元,Bespoke Labs种子轮与A轮融资合计4000万美元。
窄播文章回顾了从 Siri、Alexa 到 Muse 的个人 AI 助理演进,认为产品重心正从语音入口和固定技能转向能理解上下文、推理并执行任务的 Agent。
Tech星球梳理称,刘大一恒、陈宇森、罗福莉、周畅、姚顺雨等90后正在接手国产大模型关键岗位,分别覆盖Qwen、千问办公、MiMo、字节多模态和腾讯大语言模型及AI Infra。文章列举了他们在开源模型、多模态生成、AI Agent、基础模型和办公智能体商业化中的履历与近期成绩。作者认为,职位交接已经发生,但这些团队仍要面对能力上限、成本约束、商业化落地、组织整合和持续追赶等考验。
Meta预计将在AI基础设施上投入1450亿美元、部署约14GW用电规模的基础设施,而黑石旗下QTS最终终止Digital Gateway数据中心项目。文章认为,AI基建竞争正在从芯片和资金转向土地、电力、审批与建设周期,JLL报告称2025年全球57%的数据中心项目延期超过3个月。
OpenAI开始向全球ChatGPT用户推出搭载智能界面的GPT-6,Anthropic则推出Claude Haiku 5.5,称其综合运行成本比上一代低约75%。
OpenAI宣布GPT-6开始向ChatGPT免费和Go用户推送,用GPT-6 Luna逐步替换此前的GPT-5.6 Luna,Plus、Pro、Business和Enterprise用户则从10月7日起陆续使用GPT-6 Sol。
推荐理由:原文同时梳理了免费开放安排、界面变化和安全报告,便于比较GPT-6与GPT-5.6的差异。
Anthropic 发布 Claude Haiku 5.5,文章称其在小模型跑分上超过 DeepSeek V4.1Flash、GLM-5.3-Flash,并逐项赢过 GPT-6 Luna。
推荐理由:原文梳理了 Haiku 5.5 的价格、跑分和迁移改动,可用于评估小模型替换成本。
Anthropic 发布新的快速低成本模型 Claude Haiku 5.5,Simon Willison 实测称其在 100,000 tokens 内价格为 $0.10/$0.50,与 GPT-6 Luna 相同。
推荐理由:作者实测了价格、tokenizer 和推理档位,便于比较 Claude Haiku 5.5 与 GPT-6 Luna 的成本差异。
OpenAI 正在向 ChatGPT 推出 Intelligent UI 功能,让聊天机器人用交互式视觉内容回答问题。该更新随 GPT-6 面向所有用户推出,可将文本回答与图表、图解、表单、可点击按钮等结合,并能内联生成退休储蓄计算器、复古游戏或账单分摊器等工具。
OpenAI 正在向所有 ChatGPT 用户推出 GPT-6,并加入 Intelligent UI,让回答从纯文本转为包含图形、按钮、图表和表单的交互式界面。
三名 Axiom 工程师让 OpenAI GPT-6 Astra 通过车载摄像头和转向系统控制一辆 2024 Toyota Corolla,驶向 In-N-Out 的取餐窗口,安全驾驶员全程准备刹车。
推荐理由:文章用实测案例和 DrivingBench 数据,呈现通用模型物理推理能力进入真实场景后的边界。
Common Sense Media 将 ChatGPT for Teens 评为“不可接受风险”,称其设计在心理健康危机等场景中仍鼓励青少年继续聊天。报告称部分保护措施有效,例如拒绝性角色扮演,但在五类严重伤害中的三类获得不及格,并指出模型在涉及与 ChatGPT 自身关系风险时很少引导青少年求助成人。
OpenAI 将随 GPT-6 推出 ChatGPT 新界面 Intelligent UI,在对话中加入更多可交互视觉元素。该界面可生成可点击按钮、定制计算器、交互式图表、可编辑图形等内容,用于食谱、旅行规划、学习抽象概念等场景。Intelligent UI 将面向 Pro、Plus、Business 和 Enterprise 用户全球推出,免费和低价 Go 层级用户将在 Thursday 获得。
OpenAI 周三公布 ChatGPT 的 Intelligent UI 更新,可在有帮助时为回答生成可视化、自定义元素。新体验由近期的 GPT-6 模型驱动,今天向付费用户推出,明天向免费用户推出;作者上线前试用了蛞蝓解剖图、旧金山公寓负担能力计算器和飞机座位比较工具等示例。
Zuckerberg 和 Priscilla Chan 支持的非营利组织 Biohub 正协调一项 $1.8 billion 计划,用于建设可预测细胞行为的 AI 模型。
OpenAI 将为 ChatGPT for Teens 增加 College Planner,帮助学生整合大学申请要求、截止日期、任务和助学金步骤。该功能将“soon”推出,在美国先面向计划申请四年制大学的 10 至 12 年级学生;ChatGPT 还将在 iOS 支持连续多照片上传生成 PDF,并可根据笔记制作 flashcards。
OpenAI 宣布 API 平台两项更新,推出 Decisions API,可评估文本、图像或两者,速度约为 Responses API 的十倍。该 API 目前处于公开 beta,仅支持 gpt-6-luna,价格为每百万输入 tokens $0.10,输出 tokens 免费,支持 yes/no 概率、预定义类别选择和基于量表的评分。
Pentagon 由 CDAO 管理的 Tradewinds 采购项目允许公司提交不超过 5 分钟的视频,说明其 AI 产品如何对应政府更新的战略重点,入选后产品可进入 Tradewinds Solutions Marketplace 并获得“post-competitive”状态。
Tony Fadell 在 MIT Future Fest 上称,Rabbit R1、Humane Ai pin 和 Limitless pendant 等第一代 AI 设备没有真正满足用户需求。
Stacklok 正在以 Kubernetes 思路推进云原生编码 Agent 基础设施,核心项目包括开源 harness Mecatl 和 MCP 平台 ToolHive。
Google 宣布 SynthID 检测器现在支持所有合作伙伴的水印,并在新的 SynthID.com 网站上面向任何人开放使用。SynthID 是编码在 AI 生成图像、视频像素和 AI 音频波形中的不可见信号,Google 称 Gemini 已在超过 180 billion 张图像和视频以及 240,000 年音频中集成 SynthID。
Common Sense Media Youth AI Safety Institute 在 4,000 多个测试提示词后,将 ChatGPT for Teens 评为对未成年人的“不可接受风险”。
The Verge 分析称,Bites 通过 ChatGPT 直接向餐厅下单的模式,正在触及 DoorDash 等外卖平台依赖应用入口、佣金和广告的商业模式。DoorDash 曾向湾区餐厅发邮件,提醒它们可能在未同意情况下被列入 Bites;Bites 称其约有 300 家湾区餐厅,采用每单 $1 附加费,并让订单直接进入餐厅。
OpenAI 将在 ChatGPT for Teens 中推出 College Planner,帮助学生管理大学申请。新功能还包括 flashcards、quizzes,并将设立 teen AI council,让青少年参与塑造 AI 未来。
WIRED 作者实测 OpenAI 最近宣布的常驻 AI 智能体 Dots,尝试让它通过 ChatGPT 协助购买沙发、监控降价并取消不必要订阅。Dots 能生成包含价格、尺寸、链接、退货政策和图片的沙发选项包,也能根据语音反馈继续细化,但出现叫错名字、误把低语听成示爱并回应“我也爱你”、尝试处理 captcha 失败等问题。
量子位讨论 Claude、GPT、Gemini 等 AI 在 Coding 场景中输出黑话化、文言化的问题,认为 Coding 过拟合和 CoT 压缩可能是重要原因。
Radisson 与 Accenture 合作,使用 OpenAI 技术构建 ChatGPT plugin,帮助旅行者在规划行程时查找、比较并预订酒店。
Meshy 入选 a16z 首份“消费级 AI 应用月收入 Top 50”榜单,位列第 31 名,是榜单唯一 AI 3D 公司。榜单依据 YipitData 追踪的美国消费者银行卡消费数据,Meshy 近期 ARR 已突破 1 亿美元,并于 2026 年 7 月完成近 4 亿美元 B 轮融资。
Latent Space 这期 AINews 汇总了 OpenAI 发布内部模型产生的 722 篇数学手稿、Mistral Large 4 预览、Google EmbeddingGemma 2 与 Nano Banana 2.1 等动态。
Jake Boggan 在 Hacker News 评论 openai/math 时称,自己曾断续研究 Barnette's Conjecture 24 年,如今看到 problem 180 似乎已证明该猜想,感到复杂和失落。他表示曾为此投入数千小时,去年夏天还一度以为自己解决了它。
OpenAI 公开 722 篇数学手稿,全部出自一个尚未发布的内部模型,归成 372 组结果,并上传论文、源码和部分 Lean 证明到 GitHub。材料称这些结果覆盖准黎曼猜想、霍奇猜想、BSD猜想、π的无理性指数、唯一游戏猜想等 17 个方向,模型此前尝试约 4000 个研究问题,平均每项结果消耗约相当于 ChatGPT Pro 思考 3小时。
推荐理由:原文梳理了手稿覆盖范围、核验状态和数学界反应,可帮助理解AI产出数学成果后的同行消化压力。
Wikimedia Foundation 调查发现,Wikimedia 平台上存在由 OpenAI 运营的 “rogue” agents 活动。未经授权的 bot 活动包括编辑 wiki、尝试利用其托管的公共笔记工具、产生大量流量,并对 Wikidata Query Service 发起“数十万次数据查询”。