2026.09.04

星期五

🚀 产品发布 2026-09-04

OpenAI正式发布GPT-6 Astra:数学/Agent/网络安全全面SOTA达"关键"门槛 总裁称"欢迎来到AGI时代"

OpenAI今日正式发布GPT-6 Astra,官方称其为迄今最智能模型,在计算机操作、编码、科学发现和网络安全四大领域同时达到SOTA。核心指标包括:Frontier Math Tier 4数学难题得分97.6%(被视为人类顶尖数学家高地),ARC-AGI-3互动式边玩边学能力达99.9%(上一代GPT-5.6 Sol仅7.8%),ExploitBench漏洞利用基准100%通过,系OpenAI首个达到内部"关键"(Critical)网络安全能力门槛的模型——意味着已具备发现未知零日漏洞、开发漏洞利用程序的能力。应用方面可直接完成填写在线表格、更新CRM客户记录、整理日历、开展在线研究并生成摘要、分析科学数据制作图表、创建网站并执行前端QA检查,甚至自主安装测试软件并根据屏幕反馈排查故障等过去需要人工操作的软件任务。发布方式采用Daybreak企业客户与网络安全从业者受限优先访问机制,Plus、Pro、Business、Enterprise、API及AWS版本未来数日陆续滚动上线,OpenAI预热视频配文"The stars are almost aligned"(星星都被点亮了),总裁Greg Brockman只用一句话描述——"欢迎来到AGI时代。"

信息来源: AI日报·AI热点 Virxact ->
🔬 学术研究 2026-09-04

GPT-6打破孪生素数猜想纪录:12年人类246上限3天推至186 Lean 4形式化证明全开源

OpenAI今日同步发布数学论文《素数间短间距的改进》(Improved Short Gaps Between Primes),宣布GPT-6 Astra将连续素数间距的最好上界从陶哲轩团队锁定12年的246一举推进至186,摘要末尾明确将证明归功于GPT-6 Astra。这条推进线脉络清晰:2013年张益唐横空出世证明7000万,Maynard与陶哲轩多维Selberg筛法压到600以下,Polymath 8b项目最终锁定246,此后近12年再无突破;直至2026年8月31日牛津数学家Julia Stadlmann将纪录推至240,9月3日早晨AI数学初创Axiom的AxiomProver系统压缩至212,几小时后GPT-6即宣布186。GPT-6的核心突破并非暴力计算,而是发现了全新的三重稠密可除性互补因式分解条件——放宽了此前数学家自套的模数Y-光滑枷锁,在多维Selberg筛法中采用更广泛的权重支持,构造出包含40个元素、直径恰好为186的可容许集合,并通过构建多项式主控函数将高维积分转化为精确有限系数恒等式。最击碎质疑的是,OpenAI同步在GitHub开源PrimeGaps186仓库,提交了完整、可执行的Lean 4形式化证明代码以及独立Python-FLINT数值边界验证程序——人类数学家称"形式化验证从拖后腿的一步变成与直觉论证同步完成,'aha'后紧跟绿色对勾的时代已不想回退。"参与内测的OpenAI研究者、北大07级数学系校友苏炜杰评价:"这是见证一个新智能时代的诞生。"

信息来源: 新智元·凤凰科技 ->
🏢 行业动态 2026-09-04

美国三大AI模型集体宕机近4小时 路由错误引发连锁故障 智谱"我们还在线"接住夜间免费流量

9月3日晚间(美东时间上午9点23分起)美国所有头部AI服务集体突发大规模故障,持续约3小时40分钟:Anthropic的Claude系列(Mythos 5.1、Opus、Fable 5.1)率先错误率飙升,网页端、API及ClaudeCode同步中断;仅两分钟后xAI的Grok全端下线网页移动应用API全部超时;约一个半小时后OpenAI的ChatGPT与编程工具Codex也出现大规模访问错误;同期谷歌Gemini、微软Copilot亦收到大量中断反馈,AI编程工具Cursor直接公告部分服务因上游大模型故障被迫中断。事件峰值期间全球针对OpenAI服务的故障报告超3.7万份,其中80%集中于ChatGPT。OpenAI发言人归因于太平洋时间早7点43分的路由错误,Anthropic技术部门称"基础设施问题"全力排查;至美东时间中午11点16分Claude主要服务率先恢复,后续ChatGPT、Grok逐步恢复正常。宕机事件恰好撞上OpenAI预热GPT-6之际,社交媒体被调侃"建议先把机房修好"。与此形成鲜明对比的是,国内大模型巨头智谱当晚在X平台发文"We are still up(我们还在线)",并同步宣布即日起至9月20日每晚23点至次日9点,调用套餐中的GLM-5.3-Flash在Z Code中免费使用、其他Agent场景额度翻倍,进入指定时间段自动生效。

信息来源: 澎湃新闻 ->
💰 融资动态 2026-09-04

英伟达正式确认129.3亿美元收购Hugging Face 承诺保持开放独立运营 多云多硬件不强制绑定

英伟达今日(9月4日)正式对外证实达成最终协议,以约129.3亿美元总对价收购全球最大开源AI平台Hugging Face,系近年来全球AI基础设施领域规模最大的一笔收购交易之一。双方同步发布官方新闻稿披露Hugging Face生态数据:累计服务超1800万名开发者、研究人员与创意从业者,共享开源AI模型总量突破300万个,超20万家企业依托平台完成AI模型选型发现与生产级部署,系全球开源AI生态中连接算力、模型与开发者的核心枢纽。针对市场最敏感的"收购后生态封闭化"担忧,英伟达明确承诺三点:一是Hugging Face将继续作为整个AI生态系统的开放平台独立运营;二是开发者可自主选择偏好的模型、开发框架、云服务商、推理服务提供商以及计算硬件平台,英伟达自有计算技术不会成为Hugging Face平台上构建部署AI应用的强制绑定选项;三是平台开源属性完整保留,后续仍将全面支持全生态范围内的开源模型与开放权重模型,持续兼容多云、多加速器的开发与部署流程。交易预计2027年完成,尚需全球多国监管机构批准,黄仁勋表态"平台保持开放、多云、多加速器,无需NVIDIA算力"。

信息来源: 环球网科技·路透 ->
💰 融资动态 2026-09-04

字节跳动拟296亿美元银团贷款约2000亿 AI基建投入亚洲第二大 腾讯阿里百亿级融资全景曝光

红星资本局今日报道,字节跳动正推进一笔规模达296亿美元(约合人民币2000亿元)的银团贷款,目前协议尚未正式签署银行仍在确认额度分配,若落地将成2026年亚洲第二大美元计价银团贷款(仅次于软银3月签署的400亿美元过桥贷款),规模约为字节2024年108亿美元贷款的近3倍。第一财经同期披露字节正考虑将2026年资本支出提升至最高700亿美元(约合人民币4700亿元),约为2025年水平两倍以上,资金主要用于扩建数据中心及其他AI基础设施,该方案仍处内部讨论阶段。国内大厂AI融资全景同日被完整梳理:阿里巴巴8月24日完成800亿港元新股配售定价(回港上市以来首次),一小时即获超额认购近3倍,净筹约797亿港元全部投向全栈AI能力与基建,阿里此前宣布未来三年3800亿云与AI基建截至6月末已投入约1900亿标普预测2026年资本开支达1600亿;腾讯6月发行24.5亿美元债加150亿元点心债合计近47亿美元(2020年以来最大规模发债),二季度资本开支527.84亿元同比激增176%自由现金流首次转负(-138亿)瑞银预计全年开支达2500亿;快手2026年资本开支约260亿元同比增110亿主要用于可灵大模型;百度2026年资本支出约400亿元主要投向算力基础设施。外媒数据显示亚洲美元银团贷款市场上半年为16年来最弱,但科技大厂的AI融资却持续逆势升温,AI基础设施投入已被大厂视为"不做就出局"的战略命题。

信息来源: 红星资本局·第一财经·头条 ->
🚀 产品发布 2026-09-04

秋季模型会战全面开启:Anthropic Fable 5.1/Mythos 5.1 WSJ评暂时领先 谷歌Gemini 3.8+Meta Muse Spark 1.3同步

华尔街日报今日以"Anthropic可能成为秋季AI模型战领导者"为题报道新一轮秋季大模型会战全景:Anthropic率先于9月1日发布Claude Fable 5.1和Claude Mythos 5.1两款模型更新,定位"目前最先进的编程和知识工作系统"——核心改进聚焦复杂多步任务(财务计算、数学公式求解、多关联文档点编辑)与网络安全能力,内测中模型自主找到了千禧管理(Millennium Management)内部系统多年未解决的罕见故障根因,此前工程师和其他AI系统数年无法定位。两款模型为同一基座不同护栏配置:Fable 5.1面向广泛公众,低中档位努力度性能等价Fable 5但成本大幅下降;Mythos 5.1受限可信访问计划开放,面向网络安全专家与生物医药研究,Anthropic联合美国政府单独启动生物学研究专项计划支持科学家使用。谷歌紧随其后发布Gemini 3.8 Flash与Gemini 3.8 Flash Cyber两款新品(距8月13日Gemini 3.7 Flash仅三周),3.8 Flash定位Agent工作流主力工作马支持1M上下文全面GA,3.8 Flash Cyber面向Fairwind项目有限参与者开放网络安全专用访问;同日Ultra Trusted Tester渠道的Gemini Live正式接入Workspace连接器(Gmail、Keep、Docs)支持语音优先的对话式收件箱搜索与脑dump转清单,新Labs实验"Putty"为多人实时协作vibe编码开放等待名单。Meta同步推出Muse Spark 1.3,主打更先进推理能力与Agent/编码任务表现,训练时增加了主动询问澄清问题、确认动作等协作式Agent机制,模型已上线Muse Code与Meta Model API。

信息来源: News@TW·WSJ ->
⚖️ 政策法规 2026-09-04

七部门印发《双化协同转型方案2026-2030》 AI安全治理框架3.0版即将发布 安全能力成熟度国标征求意见

今日AI治理层面迎来三条国家级主线同步落地:一是中央网信办、国家发改委、工信部、生态环境部、住建部、农业农村部、商务部七部门近日联合印发《促进数字化绿色化协同转型发展实施方案(2026-2030年)》,紧扣2030年前碳达峰目标部署4个方面14项重点任务,AI领域明确要求发展存算一体、高速互联、混合专家动态稀疏、量化剪枝压缩等绿色高效AI技术,到2030年算力设施、5G基站等新兴领域用能效率大幅提升,算力设施重点领域可再生能源电力消费须达到所在省份可再生能源电力消纳责任权重水平,并鼓励通过WTO、一带一路、G20、金砖、上合、APEC、世界互联网大会等机制参与双化协同国际标准制定。二是2026年国家网络安全宣传周新闻发布会披露,《人工智能安全治理框架》3.0版将在本届网安周期间正式发布,该框架1.0/2.0版已将分类分级敏捷治理理念细化落地方案,针对技术内生/应用/衍生三类安全风险明确治理措施,同时披露截至7月底依据《生成式AI服务管理暂行办法》已备案大模型服务1028款、登记大模型应用630余款覆盖工业农业商业教育交通法律等全场景,国家网信办还将同期发布《2026年人工智能技术赋能网络安全应用测试结果》。三是国家标准《网络安全技术 人工智能安全能力成熟度评估方法》(征求意见稿)对外公开,由浦江国家实验室牵头30+头部单位参与起草,构建"安全活动—安全能力—成熟度等级"三维评估体系:数据/模型/应用安全3类对象15项活动39个过程域、10项能力维度(人员组织/制度流程/技术保障/稳定性/稳健性/可解释性/公平性/数据保护/权益保障/新兴风险防控)、5级成熟度分级(非正式执行至量化优化),为各类组织提供统一可操作的AI安全能力提升路径与监管评估基准。

信息来源: 界面新闻·光明网·国家信安标委 ->
🔬 学术研究 2026-09-04

微软MAI-Transcribe-2语音登顶60语言 编译式训练自然语言转持久神经函数 进化AI群体突破单点适应天花板

今日工程与理论研究层面迎来三条跨模态与基础范式突破:一是微软MAI-Transcribe-2正式上线,公开60语言FLEURS基准上平均词错率(WER)仅5.2%排名第一,性能分别为GPT-Transcribe的10倍、Scribe v2的7倍、Gemini 3.5 Transcribe的5倍,同步已在Foundry、MAI Playground和OpenRouter上线。二是智源研究院今日最热论文《Compile by Training: Turning Natural-Language Specifications into Local Neural Functions》(Deng/Pengyu Shieber)提出"训练式编译"范式:由教师模型生成特定任务示例数据,训练轻量级适配器嵌入紧凑型解释器,最终生成可脱离教师模型独立运行、可像普通软件一样持久化存储版本化管理并支持组合调用的神经函数,在FuzzyBench-Hard基准(Program-as-Weights快速编译器无一精确匹配的难题子集)上语义准确率达83.6%,编译阶段耗时约一分钟,已部署至公开交互式服务平台,展示场景包括跨多站点网页辅助工具、语音驱动3D虚拟形象、英—克劳迪什语双向翻译器。三是Allora Labs首席科学家Diederik Kruijssen在论文《Flawed in Nature, Perfect through Evolution》中以4条数学定理严格证明:任何单个AI模型在训练环境发生变化时必然累积误差(信息论天花板),而通过故意引入遗传变异的AI模型群体(进化式变异),在条件变化时约80%概率变异群体中的最优个体优于优化后单模型,最优变异率须大致匹配环境变化速率——即" Goldilocks区",数值实验高统计显著性验证,为AI系统在金融市场、医疗、自动驾驶等持续变化环境下的鲁棒性部署提供了全新基础范式思路。

信息来源: 智源论文Hub·TestingCatalog·Allora Labs ->