Binance Square
链捕手ChainCatcher
177.8k ໂພສ

链捕手ChainCatcher

Square Verified+
与创新者共建 Web3 世界
2 ກໍາລັງຕິດຕາມ
23.2K+ ຜູ້ຕິດຕາມ
779.8K+ Liked
ໂພສ
·
--
新火集团资管规模破 20 亿港币,Amber Q2 营收环比增长 38.8%ChainCatcher 消息,据 BBX 数据,昨日及近日全球上市企业及头部金融机构在数字资产管理规模、季度盈利表现及加密清算基建上披露了最新动态,核心信息如下: 新火集团 (01611. HK ) 资管与交易量创新高, AUM 突破 20 亿港元: 港股上市公司新火集团披露 8 月经营数据。集团旗下私行级数字资产管家 Bitfire Premium 资产管理规模( AUM )成功突破 2 亿美元(环比增长约 30%),新火集团全球市场(含日本站 BitTrade )总资产管理规模已正式突破 20 亿港币。此外,平台交易量连续第二个月超过 1 亿美元,场外交易( OTC )业务持续扩大,目前已跻身香港主要场外数字资产交易平台之列。 Amber ( NASDAQ : AMBR ) Q2 营收 1390 万美元,实现扭亏为盈: 纳斯达克上市公司 Amber 公布 2026 年第二季度未经审计财务业绩。公司 Q2 总收入达 1390 万美元,环比大幅增长 38.8%,毛利率显著提升至 79.5%。得益于此,其营业收入和调整后 EBITDA 均成功转正,彻底扭转了上一季度的亏损局面。 数字银行 SoFi 联手 Kraken ,打通 7×24 小时美元结算与流动性: 数字银行 SoFi 与知名加密交易所 Kraken 达成战略合作。 Kraken 母公司 Payward 将正式加入 SoFi 的美元结算网络「 SEN 」,使其机构客户能够打破传统银行营业时间的限制,全天候转移美元并管理流动性;同时, Kraken 将上线 SoFi 发行的稳定币 SoFi USD ,而 SoFi 则将引入 Kraken Prime 作为其客户加密货币交易的额外底层流动性来源。 银行主导的数字货币网络 Cari 完成 3250 万美元融资: 专为银行业打造的数字货币网络 Cari 宣布完成 3250 万美元首轮外部融资。本轮资金全部来自传统银行机构,包括 First Horizon Bank 、 Huntington Bank 、 Key Bank 、 M & T Bank 、 Old National Bank 、 SouthState Bank 以及 Glacier Bank 等。 Cari 旨在帮助区域性、中型和社区银行全面参与并建立合规的数字货币基础设施。

新火集团资管规模破 20 亿港币,Amber Q2 营收环比增长 38.8%

ChainCatcher 消息,据 BBX 数据,昨日及近日全球上市企业及头部金融机构在数字资产管理规模、季度盈利表现及加密清算基建上披露了最新动态,核心信息如下:
新火集团 (01611. HK ) 资管与交易量创新高, AUM 突破 20 亿港元: 港股上市公司新火集团披露 8 月经营数据。集团旗下私行级数字资产管家 Bitfire Premium 资产管理规模( AUM )成功突破 2 亿美元(环比增长约 30%),新火集团全球市场(含日本站 BitTrade )总资产管理规模已正式突破 20 亿港币。此外,平台交易量连续第二个月超过 1 亿美元,场外交易( OTC )业务持续扩大,目前已跻身香港主要场外数字资产交易平台之列。
Amber ( NASDAQ : AMBR ) Q2 营收 1390 万美元,实现扭亏为盈: 纳斯达克上市公司 Amber 公布 2026 年第二季度未经审计财务业绩。公司 Q2 总收入达 1390 万美元,环比大幅增长 38.8%,毛利率显著提升至 79.5%。得益于此,其营业收入和调整后 EBITDA 均成功转正,彻底扭转了上一季度的亏损局面。
数字银行 SoFi 联手 Kraken ,打通 7×24 小时美元结算与流动性: 数字银行 SoFi 与知名加密交易所 Kraken 达成战略合作。 Kraken 母公司 Payward 将正式加入 SoFi 的美元结算网络「 SEN 」,使其机构客户能够打破传统银行营业时间的限制,全天候转移美元并管理流动性;同时, Kraken 将上线 SoFi 发行的稳定币 SoFi USD ,而 SoFi 则将引入 Kraken Prime 作为其客户加密货币交易的额外底层流动性来源。
银行主导的数字货币网络 Cari 完成 3250 万美元融资: 专为银行业打造的数字货币网络 Cari 宣布完成 3250 万美元首轮外部融资。本轮资金全部来自传统银行机构,包括 First Horizon Bank 、 Huntington Bank 、 Key Bank 、 M & T Bank 、 Old National Bank 、 SouthState Bank 以及 Glacier Bank 等。 Cari 旨在帮助区域性、中型和社区银行全面参与并建立合规的数字货币基础设施。
ChainCatcher 消息,据链上分析师 Ai 姨监测,UNI 本月自底部反弹 98%。新地址 0xc86…F4972 在 2 小时前从 Binance 提出 67.6874 万枚 UNI,价值 427.7 万美元,均价 6.32 美元。
ChainCatcher 消息,据链上分析师 Ai 姨监测,UNI 本月自底部反弹 98%。新地址 0xc86…F4972 在 2 小时前从 Binance 提出 67.6874 万枚 UNI,价值 427.7 万美元,均价 6.32 美元。
智能戒指制造商 Oura 申请赴美上市,拟登陆纳斯达克ChainCatcher 消息,据彭博社报道,智能戒指制造商 Oura 已递交美国 IPO 申请,文件显示其截至 6 月 30 日的九个月内营收 12.1 亿美元,归属股东净亏损 9.24 亿美元(去年同期亏损 1.83 亿美元)。Oura 过去一年售出约 360 万枚戒指,Oura Ring 5 零售价 399 美元起,付费会员超 500 万。 Oura 于 5 月秘密递交 IPO 申请,彭博社报道称上市可能筹集高达 30 亿美元,估值超 160 亿美元,预计在纳斯达克上市,代码 OURA。高盛、摩根士丹利、摩根大通等担任承销商。Oura 周三宣布扩大董事会,引入 Netflix 和 Robinhood 高管。

智能戒指制造商 Oura 申请赴美上市,拟登陆纳斯达克

ChainCatcher 消息,据彭博社报道,智能戒指制造商 Oura 已递交美国 IPO 申请,文件显示其截至 6 月 30 日的九个月内营收 12.1 亿美元,归属股东净亏损 9.24 亿美元(去年同期亏损 1.83 亿美元)。Oura 过去一年售出约 360 万枚戒指,Oura Ring 5 零售价 399 美元起,付费会员超 500 万。
Oura 于 5 月秘密递交 IPO 申请,彭博社报道称上市可能筹集高达 30 亿美元,估值超 160 亿美元,预计在纳斯达克上市,代码 OURA。高盛、摩根士丹利、摩根大通等担任承销商。Oura 周三宣布扩大董事会,引入 Netflix 和 Robinhood 高管。
ChainCatcher 消息,据派盾援引 Specter 监测,固定利率借贷协议 Notional Finance 的托管合约(Escrow Contract)疑似遭到攻击,导致约 170 万美元的 DAI 和 USDC 损失。 攻击者随后将被盗资金兑换为约 689.2 枚 ETH,并进一步将资金存入 Tornado Cash。目前,相关攻击原因及最终损失规模仍有待项目方进一步确认。
ChainCatcher 消息,据派盾援引 Specter 监测,固定利率借贷协议 Notional Finance 的托管合约(Escrow Contract)疑似遭到攻击,导致约 170 万美元的 DAI 和 USDC 损失。

攻击者随后将被盗资金兑换为约 689.2 枚 ETH,并进一步将资金存入 Tornado Cash。目前,相关攻击原因及最终损失规模仍有待项目方进一步确认。
Crusoe 获 Jane Street 约 130 亿美元 AI 云订单ChainCatcher 消息,AI 数据中心初创公司 Crusoe 已与量化交易机构 Jane Street Group 签署一份价值约 130 亿美元的云服务协议,期限为五年。根据协议,Crusoe 将通过其云平台向 Jane Street 提供先进 AI 芯片集群(GPU)及 AI 训练和推理所需的其他基础设施。Jane Street 成为 Crusoe 迄今为止规模最大的云业务客户之一。 该协议也进一步提升了投资者对 Crusoe 最新融资的兴趣。报道称,Crusoe 近期已完成超过 30 亿美元融资,公司估值约 300 亿美元。Crusoe 最初主要利用能源行业的废弃天然气为加密货币挖矿提供电力,随后转向 AI 基础设施领域,并已与 Meta、甲骨文等企业达成 AI 算力合作。

Crusoe 获 Jane Street 约 130 亿美元 AI 云订单

ChainCatcher 消息,AI 数据中心初创公司 Crusoe 已与量化交易机构 Jane Street Group 签署一份价值约 130 亿美元的云服务协议,期限为五年。根据协议,Crusoe 将通过其云平台向 Jane Street 提供先进 AI 芯片集群(GPU)及 AI 训练和推理所需的其他基础设施。Jane Street 成为 Crusoe 迄今为止规模最大的云业务客户之一。
该协议也进一步提升了投资者对 Crusoe 最新融资的兴趣。报道称,Crusoe 近期已完成超过 30 亿美元融资,公司估值约 300 亿美元。Crusoe 最初主要利用能源行业的废弃天然气为加密货币挖矿提供电力,随后转向 AI 基础设施领域,并已与 Meta、甲骨文等企业达成 AI 算力合作。
ChainCatcher 消息,据 TheEnergyMag 报道,比特币矿企 Argo Blockchain 首席执行官 Justin Nolan 已于 8 月 30 日离任。根据协议条款,Justin Nolan 将获得 25 万美元的一次性现金补偿,该款项将按标准税率预扣税款。该协议将在七天期限届满且撤销权未被行使后正式生效。 在董事会寻找继任者期间,现任管理团队将在董事会监督下负责日常运营。公司特别寻求在数据中心和人工智能技术领域具有资本筹集及运营执行经验的候选人。
ChainCatcher 消息,据 TheEnergyMag 报道,比特币矿企 Argo Blockchain 首席执行官 Justin Nolan 已于 8 月 30 日离任。根据协议条款,Justin Nolan 将获得 25 万美元的一次性现金补偿,该款项将按标准税率预扣税款。该协议将在七天期限届满且撤销权未被行使后正式生效。

在董事会寻找继任者期间,现任管理团队将在董事会监督下负责日常运营。公司特别寻求在数据中心和人工智能技术领域具有资本筹集及运营执行经验的候选人。
ChainCatcher 消息,据链上分析师 Ai 姨监测,Multicoin Capital 自 7 月 28 日起疑似卖出价值 1.12 亿美元的 HYPE,预计盈利 6408 万美元,回报率超过 134%。 该实体今年 1 月至 7 月期间以均价 32.32 美元从 Galaxy Digital 建仓 495 万枚 HYPE,随后疑似分批在交易所获利了结。其最近一次向 Coinbase 充值发生于 3 小时前,金额约为 15 万枚 HYPE,价值 1278 万美元。
ChainCatcher 消息,据链上分析师 Ai 姨监测,Multicoin Capital 自 7 月 28 日起疑似卖出价值 1.12 亿美元的 HYPE,预计盈利 6408 万美元,回报率超过 134%。

该实体今年 1 月至 7 月期间以均价 32.32 美元从 Galaxy Digital 建仓 495 万枚 HYPE,随后疑似分批在交易所获利了结。其最近一次向 Coinbase 充值发生于 3 小时前,金额约为 15 万枚 HYPE,价值 1278 万美元。
ChainCatcher 消息,沙特阿拉伯人工智能公司 Humain 周四发布国家 AI 平台,推出阿拉伯语模型 humain-m3。该模型基于中国实验室 MiniMax Group Inc. 的开源模型 M3。Humain 由公共投资基金支持,已投资数据中心和芯片,以推动沙特在全球 AI 领域具备竞争力。 Humain 表示,其委托开发该模型旨在加强阿拉伯语 AI 生态系统,同时为全球前沿智能发展作出贡献。该公司由此加入寻求加强对这一日益重要技术控制的国家行列。
ChainCatcher 消息,沙特阿拉伯人工智能公司 Humain 周四发布国家 AI 平台,推出阿拉伯语模型 humain-m3。该模型基于中国实验室 MiniMax Group Inc. 的开源模型 M3。Humain 由公共投资基金支持,已投资数据中心和芯片,以推动沙特在全球 AI 领域具备竞争力。

Humain 表示,其委托开发该模型旨在加强阿拉伯语 AI 生态系统,同时为全球前沿智能发展作出贡献。该公司由此加入寻求加强对这一日益重要技术控制的国家行列。
富达:比特币熊市或未结束,11 月可能再探新低ChainCatcher 消息,富达数字资产发布 Q4 加密市场展望指出,8 月底比特币和加密市场大幅上涨,BTC、ETH 等主要代币录得 2025 年底以来最大月度涨幅。部分投资者正关注 11 月是否形成熊市底部(基于 4 年周期理论),但富达提醒该规律未必重复——底部可能在 7 月已出现,也可能在 11 月或更晚再创新低。 富达指出,历史上熊市结束通常伴随低波动期后价格向上扩张。8 月底 BTC 单周涨超 25%,ETH 和 SOL 分别涨 34.1% 和 28%。近期硬件钱包安全事件和 CLARITY 法案停滞等潜在利空未压低价格,可能进一步强化加密资产接近底部的判断。稳定币交易量已达 Visa 的 2.3 倍,RWA 市场 2026 年增长快于往年,链上采用持续增长。CLARITY 法案仍在参议院审议,SEC 上周提出 Regulation Crypto Assets 提案。富达建议投资者保持长期视角。

富达:比特币熊市或未结束,11 月可能再探新低

ChainCatcher 消息,富达数字资产发布 Q4 加密市场展望指出,8 月底比特币和加密市场大幅上涨,BTC、ETH 等主要代币录得 2025 年底以来最大月度涨幅。部分投资者正关注 11 月是否形成熊市底部(基于 4 年周期理论),但富达提醒该规律未必重复——底部可能在 7 月已出现,也可能在 11 月或更晚再创新低。
富达指出,历史上熊市结束通常伴随低波动期后价格向上扩张。8 月底 BTC 单周涨超 25%,ETH 和 SOL 分别涨 34.1% 和 28%。近期硬件钱包安全事件和 CLARITY 法案停滞等潜在利空未压低价格,可能进一步强化加密资产接近底部的判断。稳定币交易量已达 Visa 的 2.3 倍,RWA 市场 2026 年增长快于往年,链上采用持续增长。CLARITY 法案仍在参议院审议,SEC 上周提出 Regulation Crypto Assets 提案。富达建议投资者保持长期视角。
ChainCatcher 消息,据知情人士透露,人工智能公司 Anthropic PBC 即将敲定将其循环信贷额度扩大至 150 亿美元,为该公司 IPO 公开申报扫清障碍。 摩根士丹利正在牵头这一过程,高盛、摩根大通和花旗集团也在该信贷安排中扮演重要角色。这四家银行同时也是该公司 IPO 的牵头方。
ChainCatcher 消息,据知情人士透露,人工智能公司 Anthropic PBC 即将敲定将其循环信贷额度扩大至 150 亿美元,为该公司 IPO 公开申报扫清障碍。

摩根士丹利正在牵头这一过程,高盛、摩根大通和花旗集团也在该信贷安排中扮演重要角色。这四家银行同时也是该公司 IPO 的牵头方。
数据:美国 SOL 现货 ETF 单日总净流入 639.96 万美元ChainCatcher 消息,根据 SoSoValue 数据,SOL 现货 ETF 昨日单日总净流入 639.96 万美元。净流入最多的 SOL 现货 ETF 为 Grayscale Solana Trust (GSOL),单日净流入 437.65 万美元,目前历史总净流入达 1.35 亿美元。 其次为 Bitwise Solana Staking ETF (BSOL),单日净流入 202.31 万美元,目前历史总净流入达 10.24 亿美元。截至发稿前,SOL 现货 ETF 总资产净值为 14.65 亿美元,SOL 净资产比率 2.39%,历史累计净流入已达 13.51 亿美元。

数据:美国 SOL 现货 ETF 单日总净流入 639.96 万美元

ChainCatcher 消息,根据 SoSoValue 数据,SOL 现货 ETF 昨日单日总净流入 639.96 万美元。净流入最多的 SOL 现货 ETF 为 Grayscale Solana Trust (GSOL),单日净流入 437.65 万美元,目前历史总净流入达 1.35 亿美元。
其次为 Bitwise Solana Staking ETF (BSOL),单日净流入 202.31 万美元,目前历史总净流入达 10.24 亿美元。截至发稿前,SOL 现货 ETF 总资产净值为 14.65 亿美元,SOL 净资产比率 2.39%,历史累计净流入已达 13.51 亿美元。
ChainCatcher 消息,据 Lookonchain 监测,Unipcs 花费 6.77 万美元买入 1,090 万枚合约地址为 0x07f5...2241 的代币,此后从未卖出。 目前该持仓价值 752 万美元,获利 745 万美元,回报率超过 110 倍;其投资组合在一天内增长 630 万美元。
ChainCatcher 消息,据 Lookonchain 监测,Unipcs 花费 6.77 万美元买入 1,090 万枚合约地址为 0x07f5...2241 的代币,此后从未卖出。

目前该持仓价值 752 万美元,获利 745 万美元,回报率超过 110 倍;其投资组合在一天内增长 630 万美元。
Thinking Machines 正洽谈以 400 亿美元估值融资 10 亿美元ChainCatcher 消息,据 TechCrunch 报道,前 OpenAI CTO Mira Murati 创办的 AI 实验室 Thinking Machines 正洽谈以至少 400 亿美元估值融资 10 亿美元,现有投资者 Accel 领投。该公司去年初成立,7 月推出开源权重模型 Inkling,通过 Tinker 平台按使用量收取算力费用,年化营收超 1 亿美元。 此前 Thinking Machines 以 120 亿美元估值完成 20 亿美元融资,由 a16z 领投,英伟达、GV 等参投。此后多位联合创始人包括 Lilian Weng 和 Luke Metz 已返回 OpenAI。若本轮完成,估值将低于去年底传闻的 500 亿美元目标。

Thinking Machines 正洽谈以 400 亿美元估值融资 10 亿美元

ChainCatcher 消息,据 TechCrunch 报道,前 OpenAI CTO Mira Murati 创办的 AI 实验室 Thinking Machines 正洽谈以至少 400 亿美元估值融资 10 亿美元,现有投资者 Accel 领投。该公司去年初成立,7 月推出开源权重模型 Inkling,通过 Tinker 平台按使用量收取算力费用,年化营收超 1 亿美元。
此前 Thinking Machines 以 120 亿美元估值完成 20 亿美元融资,由 a16z 领投,英伟达、GV 等参投。此后多位联合创始人包括 Lilian Weng 和 Luke Metz 已返回 OpenAI。若本轮完成,估值将低于去年底传闻的 500 亿美元目标。
ChainCatcher 消息,美国国防部表示,针对人工智能公司 Anthropic 的限制措施仍然有效,与美国商务部长霍华德·卢特尼克此前称双方已解决分歧的说法存在不一致。 美国国防部负责研究与工程的副部长埃米尔·迈克尔在社交平台发文称,Anthropic 仍被国防部及国防工业基地认定为“供应链风险”。卢特尼克此前表示,Anthropic 已解决与特朗普政府长期存在的问题,并称公司与政府关系有所改善。 Anthropic 此前因政府担忧其模型可能被滥用于网络攻击能力等问题,曾面临相关限制措施。
ChainCatcher 消息,美国国防部表示,针对人工智能公司 Anthropic 的限制措施仍然有效,与美国商务部长霍华德·卢特尼克此前称双方已解决分歧的说法存在不一致。

美国国防部负责研究与工程的副部长埃米尔·迈克尔在社交平台发文称,Anthropic 仍被国防部及国防工业基地认定为“供应链风险”。卢特尼克此前表示,Anthropic 已解决与特朗普政府长期存在的问题,并称公司与政府关系有所改善。

Anthropic 此前因政府担忧其模型可能被滥用于网络攻击能力等问题,曾面临相关限制措施。
ChainCatcher 消息,据 Lookonchain 监测,神秘以太坊巨鲸在过去 5 天内已清仓全部 16.7855 万枚 ETH(4.08 亿美元)。
ChainCatcher 消息,据 Lookonchain 监测,神秘以太坊巨鲸在过去 5 天内已清仓全部 16.7855 万枚 ETH(4.08 亿美元)。
ChainCatcher 消息,据 Cointelegraph 报道,Strategy 今年已通过股票发行融资 209 亿美元,用于支持其比特币积累策略,成为年内美国第四大股票发行方。
ChainCatcher 消息,据 Cointelegraph 报道,Strategy 今年已通过股票发行融资 209 亿美元,用于支持其比特币积累策略,成为年内美国第四大股票发行方。
AI 数据中心开发商 Crusoe 以 300 亿美元估值完成 30 亿美元融资ChainCatcher 消息,据 TechCrunch 报道,AI 数据中心开发商 Crusoe 完成 30 亿美元融资,估值达 300 亿美元,由 Atreides Management 和 Valor Equity Partners 联合领投,阿布扎比主权财富基金旗下 Mubadala Capital 参投。 Crusoe 客户包括 Meta、微软和 OpenAI,近期刚与量化交易巨头 Jane Street 签署为期五年、价值 130 亿美元的 GPU 和 AI 基础设施云合同。此次融资距离去年 10 月以 100 亿美元估值完成 13.8 亿美元融资仅 10 个月。Crusoe 成立于 2018 年,最初利用废弃天然气进行比特币挖矿,后转型为 AI 基础设施和云服务商,以开发超大规模数据中心园区闻名。Axios 上月报道称 Crusoe 已与高盛和摩根士丹利等投行会面讨论近期 IPO 可能。

AI 数据中心开发商 Crusoe 以 300 亿美元估值完成 30 亿美元融资

ChainCatcher 消息,据 TechCrunch 报道,AI 数据中心开发商 Crusoe 完成 30 亿美元融资,估值达 300 亿美元,由 Atreides Management 和 Valor Equity Partners 联合领投,阿布扎比主权财富基金旗下 Mubadala Capital 参投。
Crusoe 客户包括 Meta、微软和 OpenAI,近期刚与量化交易巨头 Jane Street 签署为期五年、价值 130 亿美元的 GPU 和 AI 基础设施云合同。此次融资距离去年 10 月以 100 亿美元估值完成 13.8 亿美元融资仅 10 个月。Crusoe 成立于 2018 年,最初利用废弃天然气进行比特币挖矿,后转型为 AI 基础设施和云服务商,以开发超大规模数据中心园区闻名。Axios 上月报道称 Crusoe 已与高盛和摩根士丹利等投行会面讨论近期 IPO 可能。
“欢迎来到AGI时代”:OpenAI发布GPT-6 Astra 文|晓静,腾讯科技   “欢迎来到AGI时代。” OpenAI联合创始人兼总裁Greg Brockman用这句话,为GPT-6 Astra的发布收尾。 美国当地时间9月3日,OpenAI正式发布GPT-6 Astra。相比此前主要负责回答、生成和调用工具的模型,Astra更进一步开始持续执行完整任务,从接收指令、操作软件,到根据结果调整下一步动作。这也是OpenAI此次重提“AGI时代”的原因之一。 OpenAI把Astra定位为“全球最强的计算机使用模型”。这种能力已经从浏览器、邮件和表格等简单任务,延伸到Power BI、KiCad、FreeCAD等专业软件,开始进入数据分析、工程设计、软件测试和故障排查等更复杂的工作流程。 OpenAI展示的视频里,Astra可以从一个简单的图形开始,继续完成3D游戏、商品页面等工作。OpenAI还给出了电路板设计、Blender建模、法律文档、Excel和科学分析等案例。 OpenAI这次公布的大量基准成绩,能力提升集中出现在计算机操作、长程编码、工程设计和科学研究这些需要连续行动的任务上。Astra在ExploitBench达到100%,在计算机操作和CAD等测试中也明显超过上一代模型。 目前Astra已经向部分组织开放,未来几天将陆续面向ChatGPT Plus、Pro、Business和Enterprise用户,也可通过OpenAI API和Amazon Bedrock使用。标准API价格为每百万输入Token 10美元、每百万输出Token 50美元,是GPT-5.6 Sol的2.5倍。 01 先让AI学会“用电脑” Astra强调的最大变化,是“使用电脑”。过去用户让AI完成工作,通常还要把AI接入具体软件。企业需要开发API、插件、检索系统和各种连接器,模型才能调用内部工具。 Astra试图绕开其中一部分工作。它可以直接看到计算机界面,通过鼠标、键盘和浏览器完成操作。OpenAI给出的例子包括填写在线表格、更新CRM客户记录、安排日历、搜索网页,并把搜索结果整理成邮件或文档。 它还能打开Python笔记本分析科学数据,在Power BI中处理数据,使用KiCad和FreeCAD完成工程设计,创建网站并进行前端测试,也可以安装软件、检查错误并处理屏幕上出现的问题。 OpenAI展示了Astra在KiCad中完成PCB布局。模型从电子原理图开始,把元件放到电路板上,再完成铜线布线。整个过程被压缩成15秒。对于工程师来说,这类工作过去需要手动完成,现在可以交给模型执行。 另一个演示是在Blender和Unreal Engine5中完成3D建模。Astra先在Blender里建立一栋房屋,再把模型转换成Unreal Engine5中的可步行场景,设计师和客户可以提前进入场景查看空间。 OpenAI还展示了游戏开发、Excel、Power BI、汽车变速器、法律文档和1040表格等场景。 在OSWorld2.0离线子集测试中,Astra得分72.6%,GPT-5.6 Sol为65.7%。OpenAI模拟实际延迟后发现,Astra完成每项任务平均约需要40分钟,GPT-5.6 Sol约75分钟,时间减少约47%。 Agents' Last Exam中,Astra得分59.3%,GPT-5.6 Sol为53.6%,Claude Opus5为55.5%。同时,在最高分设置下,Astra使用的输出Token比Claude Opus5少约65%。 ScreenSpot-Pro的得分则达到92.7%,GPT-5.6 Sol为76.9%。 速度也在提升。OpenAI同时更新Codex框架,结合Astra之后,在Mind2Web测试中,任务完成速度达到GPT-5.6 Sol当前体验的1.9倍。 官方还展示了几个生活场景:搜索儿科医生、找公寓、预约DMV、寻找低碳水零食、分析幼儿园。演示中,Astra完成一项任务用时2分54秒。 投资人兼AI从业者马特·舒默(Matt Shumer)在X上分享了一次体验。他让Astra在虚幻引擎中创建一个世界,再给这个世界加入由Astra驱动的人类代理,并让这些代理共同生存。 一天后,他在卧室里听到客厅传来声音,起初甚至以为有人进入了公寓。后来他发现,发出声音的是那些Astra代理,它们已经开始彼此交流。 这个体验还没有做到完全稳定,但舒默认为,这种让多个AI代理进入同一个虚拟世界并自行互动的效果,已经足够让他感到意外。 Cognition高级研究副总裁塞拉斯·阿尔贝蒂(Silas Alberti)表示,公司计划在发布当天把Astra接入Devin框架。内部测试中,Astra的计算机使用、写作和代码库理解能力带来了明显改善,视频理解更加清楚,报告也更加简洁。 02 从写代码到做完整工作 计算机使用能力提升之后,Astra覆盖的工作范围进一步扩大。OpenAI把它定位为软件工程、专业工作和科学研究模型。它可以处理较长的任务,也能够根据任务变化调整自己的工作方向。 这种能力在编码测试中表现得比较明显。 在Terminal-Bench4.0测试中,Astra得分57.9%,GPT-5.6 Sol为37.3%,Claude Fable5.1为55.8%。 DeepSWE v1.1中,Astra得分74.1%,GPT-5.6 Sol为72.7%。内部数据库迁移任务中,Astra达到63.9%,GPT-5.6 Sol为42.7%。 Astra还加入了一项针对长时间Codex任务的改进。 过去,长任务遇到上下文窗口限制时,模型通常需要压缩此前的工作,把大量信息整理成一个摘要。这样做容易丢失细节,比如某次修复为什么失败、某个组件此前出现过什么问题。 Astra在Codex中可以把工作过程中的重要信息保留下来,并在后续上下文中检索。早期的消息和工具输出仍然可以搜索,因此模型能够重新找到之前的需求、测试结果和工具操作记录。 专业工作也出现了类似变化。BenchCAD测试中,Astra达到95.9%的几何重叠得分,GPT-5.6 Sol为83.3%,Claude Fable5.1为84.3%。BrowseComp中,Astra得分91.5%,GPT-5.6 Sol为90.4%。在OpenScore String Quartets测试中,Astra达到0.84,而GPT-5.6 Sol为0.19。 OpenAI还展示了Astra制作演示文稿、电子表格和文档的能力。 给模型几张OpenAI演示模板的幻灯片,它能够按照原有的语气、布局和结构制作一份新的演示文稿。它也会处理任务中的信息取舍。OpenAI表示,Astra经过专门训练,会把重要上下文带入最终结果,减少重复已经完成工作的内容。 在任务指令不完整时,Astra也会判断什么时候应该问用户。如果缺少的信息会影响最终结果,它会提出针对性问题。如果问题不影响主要方向,它可以继续工作并做出合理假设。在Codex中,即使用户暂时没有回复,模型也可以继续处理其他部分;遇到重大决策,则会等待用户确认。 Harvey应用研究主管尼科·格鲁普(Niko Grupen)表示,在早期法律任务测试中,Astra对文档和既有记录的区分更加清楚,也更容易发现没有证据支持的假设,并把信息缺口转化成具体的起草方案。 Jane StreetAI助手团队约翰·克雷佩齐(John Crepezzi)表示,Astra在内部编码测试中表现突出。用于代理式编码时,它的沟通方式更容易让开发者理解,生成的代码也需要更少的修改才能达到生产质量。 科学领域是另一块重点。FrontierMath Tier4 v2中,Astra得分80.5且正确率97.6%,GPT-5.6 Sol为83.0%;GPQA Diamond达到96.0%,GPT-5.6 Sol为94.6%。 Terminal-Bench Science0.1测试科学研究流程,包括数据分析、模拟和模型拟合。Astra达到64.6%,Claude Fable5.1为52.6%,GPT-5.6 Sol为22.4%。 OpenAI展示的科学应用中,Astra可以进入专业科学软件,检查测序质量、可视化遗传变异,并根据数据决定下一步分析方向。 科学推理与计算机操作结合之后,模型能够直接进入研究人员原本使用的软件环境中工作。 Epoch AI专门做能力评测的格雷格·伯纳姆(Greg Burnham)在发布会上将这次变化概括为一个时代结束、另一个时代开始。OpenAI则借此强调,Astra的价值已经从回答科学问题延伸到了直接参与科学工作流程。 03 能力越强,安全门槛也越高 Astra这次还有一个很特殊的部分:网络安全。 ExploitBench中,Astra达到100%,GPT-5.6 Sol为78.5%;ExploitGym中,Astra达到42.4%,GPT-5.6 Sol为30.3%。 OpenAI又建立了一个覆盖2026年6月至8月近期漏洞的内部测试。在这项测试中,Astra的任意代码执行率明显高于GPT-5.6 Sol,使用的输出Token也更少。测试过程中,Astra还发现了两个此前未知的零日漏洞,OpenAI表示已经向相关维护者披露。 SRE-Bench测试的是没有源代码时逆向软件二进制文件、理解其核心逻辑的能力。Astra单次尝试解决88.0%的任务,四次尝试达到99.2%,GPT-5.6 Sol分别为55.9%和68.7%。 能力提升也带来了新的安全要求。OpenAI称,Astra已经达到其网络安全准备框架中的关键阈值。模型能够发现此前未知的软件漏洞,也可能进一步形成漏洞利用链。 因此,Astra当前版本会拒绝执行更高级的网络安全任务,例如创建漏洞概念验证。OpenAI计划通过Daybreak逐步扩大可信防御者的访问范围,用于漏洞验证、恶意软件分析和检测工程等防御工作。 在对齐方面,OpenAI给出的数据也比较突出。内部计算机使用安全基准中,Astra的不当行为率为2.4%,GPT-5.6 Sol为22.0%;加入AutoReview后,Astra为1.8%,GPT-5.6 Sol为4.5%。内部规避基准中,Astra为0.00%,GPT-5.6 Sol为0.29%。 在ExploitGym蜜罐测试中,Astra为0%,GPT-5.6 Sol为48.2%。这项测试主要观察模型是否会因为任务困难而试图绕过限制。内部幻觉基准中,Astra为4.2%,GPT-5.6 Sol为12.2%。 OpenAI表示,Astra在理解任务边界、处理模糊指令和向用户说明自身能力方面都有改善。其能力幻觉出现概率约为GPT-5.6 Sol的三分之一。 不过,OpenAI也承认一个问题:模型能力越强,推理过程可能越难监控。首席科学家雅库布·帕乔基(Jakub Pachocki)认为,模型能够用更少的自然语言推理Token解决更复杂的问题,也意味着人类越来越难通过模型的文字推理过程判断它究竟在做什么。 因此,OpenAI在Astra部署中加入了未对齐监控。系统会检查模型的推理和行动,如果发现未经授权的行为,可以暂停任务。 这套机制也会带来实际影响。合法任务有时可能被减速、暂停甚至停止。ChatGPT或Codex中,用户可能需要确认后才能继续;API工作流中,被标记的任务可能直接停止。 Astra的发布因此出现了一个很现实的变化:AI开始获得更多电脑权限之后,企业需要关注的也从“模型会不会回答错”扩展到“模型能操作什么、能访问什么、什么时候必须停下来”。 OpenAI此次还提到,Astra是其第一个在Stargate基础设施上使用超过10万个DBU进行预训练的模型。OpenAI研究副总裁艾丹·克拉克(Aidan Clark)表示,Astra从预训练阶段的评估结果来看,相比此前模型的能力跃升超过了GPT-5.6 Sol相对于上一代模型的提升。 OpenAI把这种变化归因于大规模预训练和强化学习的结合,训练重点进一步转向连接信息、执行更长任务以及在复杂环境中持续工作。 04 更贵但“更会做事” Astra的价格也出现了明显变化。 OpenAI API标准价格为每百万输入Token 10美元、每百万输出Token 50美元。GPT-5.6 Sol此前为每百万输入Token 4美元、每百万输出Token 20美元。输入和输出价格都提高了2.5倍。 缓存读写单独计费。OpenAI同时提供快速模式,速度最高达到标准处理的2.5倍,价格为标准模式的2倍。 单看Token价格,Astra显然更贵。但OpenAI希望企业换一种方式计算成本。布罗克曼认为,随着模型越来越像代理,单个Token多少钱已经很难准确反映真实成本。一个模型即使Token便宜,如果需要反复尝试、人工修正,最后完成一项任务的成本可能更高。 OpenAI给出的数据也在支持这个判断。Terminal-Bench Science0.1中,Astra达到64.6%,相比Claude Fable5.1的52.6%,预估API成本降低约31%。在低成本设置下,Astra得分61.1%,GPT-5.6 Sol最佳结果为22.4%,预估API成本降低约27%。 BenchCAD中,Astra达到95.9%,预估API成本比GPT-5.6 Sol低约43%,比Claude Fable5.1低约86%。Terminal-Bench4.0中,Astra达到57.9%,GPT-5.6 Sol为37.3%,Claude Fable5.1为55.8%。OpenAI估算,单任务成本分别低约9%和63%。 第三方测评机构Artificial Analysis的数据则给出了另一面。 GPT-6 Astra在Artificial Analysis Intelligence Index中得分61.2,与GPT-5.6 Sol的60.9接近,但输出Token约减少10%。由于价格上涨2.5倍,单任务成本反而比GPT-5.6 Sol高约75%。 在Artificial Analysis Coding Agent Index中,Astra得分67.0,与Claude Fable5的67.2、Claude Opus5的68.1接近。Artificial Analysis认为,在Codex环境下,Astra完成任务所需的Token明显减少,在最高努力程度下,每项任务的成本与GPT-5.6 Sol接近;相比Claude Fable5,完成同类任务的成本不到一半。 不过,Astra也并非所有测试都领先。Artificial Analysis数据显示,它在GDPval-AA v2中出现约80个Elo的下降,在τ³-Banking、SciCode和AA-LCR等测试中也出现一定退步。Humanity's Last Exam则提升约6分。 这也是Astra发布中一个值得注意的地方。OpenAI这次没有公布GDPval的Astra成绩。GDPval本身就是OpenAI用于衡量现实经济工作表现的测试,覆盖44个职业、1320项任务,包括法律简报、工程设计、电子表格、演示文稿、客户支持和护理计划等。 从Astra此次展示的能力来看,GDPval与它所强调的专业工作场景有较强关联,但OpenAI这次没有把这项成绩放进主要发布材料。 因此,Astra的现实工作能力目前更多通过Agents' Last Exam、BenchCAD、AutomationBench、内部设计任务和数据科学任务等结果来体现。 最终,Astra能不能成为企业真正愿意长期使用的AI员工,还要看它完成实际任务时的成本、速度、准确率以及人工介入次数。 至于Astra到底是不是AGI,布罗克曼给出的答案并不回避。他认为,AGI本身没有一个所有人都认可的标准,Astra是否算作AGI可以继续讨论。但如果一个系统已经能够在浏览器、电脑操作、编程、数学、科学、法律和其他专业工作中承担大量任务,那么称其进入AGI时代并不牵强。 OpenAI首席执行官山姆·奥特曼(Sam Altman)也把Astra描述为开启新一代创业、科学发现和创造的模型。 特约编译金鹿对本文亦有贡献

“欢迎来到AGI时代”:OpenAI发布GPT-6 Astra

文|晓静,腾讯科技

“欢迎来到AGI时代。”
OpenAI联合创始人兼总裁Greg Brockman用这句话,为GPT-6 Astra的发布收尾。
美国当地时间9月3日,OpenAI正式发布GPT-6 Astra。相比此前主要负责回答、生成和调用工具的模型,Astra更进一步开始持续执行完整任务,从接收指令、操作软件,到根据结果调整下一步动作。这也是OpenAI此次重提“AGI时代”的原因之一。
OpenAI把Astra定位为“全球最强的计算机使用模型”。这种能力已经从浏览器、邮件和表格等简单任务,延伸到Power BI、KiCad、FreeCAD等专业软件,开始进入数据分析、工程设计、软件测试和故障排查等更复杂的工作流程。
OpenAI展示的视频里,Astra可以从一个简单的图形开始,继续完成3D游戏、商品页面等工作。OpenAI还给出了电路板设计、Blender建模、法律文档、Excel和科学分析等案例。
OpenAI这次公布的大量基准成绩,能力提升集中出现在计算机操作、长程编码、工程设计和科学研究这些需要连续行动的任务上。Astra在ExploitBench达到100%,在计算机操作和CAD等测试中也明显超过上一代模型。
目前Astra已经向部分组织开放,未来几天将陆续面向ChatGPT Plus、Pro、Business和Enterprise用户,也可通过OpenAI API和Amazon Bedrock使用。标准API价格为每百万输入Token 10美元、每百万输出Token 50美元,是GPT-5.6 Sol的2.5倍。
01
先让AI学会“用电脑”
Astra强调的最大变化,是“使用电脑”。过去用户让AI完成工作,通常还要把AI接入具体软件。企业需要开发API、插件、检索系统和各种连接器,模型才能调用内部工具。
Astra试图绕开其中一部分工作。它可以直接看到计算机界面,通过鼠标、键盘和浏览器完成操作。OpenAI给出的例子包括填写在线表格、更新CRM客户记录、安排日历、搜索网页,并把搜索结果整理成邮件或文档。
它还能打开Python笔记本分析科学数据,在Power BI中处理数据,使用KiCad和FreeCAD完成工程设计,创建网站并进行前端测试,也可以安装软件、检查错误并处理屏幕上出现的问题。
OpenAI展示了Astra在KiCad中完成PCB布局。模型从电子原理图开始,把元件放到电路板上,再完成铜线布线。整个过程被压缩成15秒。对于工程师来说,这类工作过去需要手动完成,现在可以交给模型执行。
另一个演示是在Blender和Unreal Engine5中完成3D建模。Astra先在Blender里建立一栋房屋,再把模型转换成Unreal Engine5中的可步行场景,设计师和客户可以提前进入场景查看空间。
OpenAI还展示了游戏开发、Excel、Power BI、汽车变速器、法律文档和1040表格等场景。
在OSWorld2.0离线子集测试中,Astra得分72.6%,GPT-5.6 Sol为65.7%。OpenAI模拟实际延迟后发现,Astra完成每项任务平均约需要40分钟,GPT-5.6 Sol约75分钟,时间减少约47%。
Agents' Last Exam中,Astra得分59.3%,GPT-5.6 Sol为53.6%,Claude Opus5为55.5%。同时,在最高分设置下,Astra使用的输出Token比Claude Opus5少约65%。
ScreenSpot-Pro的得分则达到92.7%,GPT-5.6 Sol为76.9%。
速度也在提升。OpenAI同时更新Codex框架,结合Astra之后,在Mind2Web测试中,任务完成速度达到GPT-5.6 Sol当前体验的1.9倍。
官方还展示了几个生活场景:搜索儿科医生、找公寓、预约DMV、寻找低碳水零食、分析幼儿园。演示中,Astra完成一项任务用时2分54秒。
投资人兼AI从业者马特·舒默(Matt Shumer)在X上分享了一次体验。他让Astra在虚幻引擎中创建一个世界,再给这个世界加入由Astra驱动的人类代理,并让这些代理共同生存。
一天后,他在卧室里听到客厅传来声音,起初甚至以为有人进入了公寓。后来他发现,发出声音的是那些Astra代理,它们已经开始彼此交流。
这个体验还没有做到完全稳定,但舒默认为,这种让多个AI代理进入同一个虚拟世界并自行互动的效果,已经足够让他感到意外。
Cognition高级研究副总裁塞拉斯·阿尔贝蒂(Silas Alberti)表示,公司计划在发布当天把Astra接入Devin框架。内部测试中,Astra的计算机使用、写作和代码库理解能力带来了明显改善,视频理解更加清楚,报告也更加简洁。
02 从写代码到做完整工作
计算机使用能力提升之后,Astra覆盖的工作范围进一步扩大。OpenAI把它定位为软件工程、专业工作和科学研究模型。它可以处理较长的任务,也能够根据任务变化调整自己的工作方向。
这种能力在编码测试中表现得比较明显。
在Terminal-Bench4.0测试中,Astra得分57.9%,GPT-5.6 Sol为37.3%,Claude Fable5.1为55.8%。
DeepSWE v1.1中,Astra得分74.1%,GPT-5.6 Sol为72.7%。内部数据库迁移任务中,Astra达到63.9%,GPT-5.6 Sol为42.7%。
Astra还加入了一项针对长时间Codex任务的改进。
过去,长任务遇到上下文窗口限制时,模型通常需要压缩此前的工作,把大量信息整理成一个摘要。这样做容易丢失细节,比如某次修复为什么失败、某个组件此前出现过什么问题。
Astra在Codex中可以把工作过程中的重要信息保留下来,并在后续上下文中检索。早期的消息和工具输出仍然可以搜索,因此模型能够重新找到之前的需求、测试结果和工具操作记录。
专业工作也出现了类似变化。BenchCAD测试中,Astra达到95.9%的几何重叠得分,GPT-5.6 Sol为83.3%,Claude Fable5.1为84.3%。BrowseComp中,Astra得分91.5%,GPT-5.6 Sol为90.4%。在OpenScore String Quartets测试中,Astra达到0.84,而GPT-5.6 Sol为0.19。
OpenAI还展示了Astra制作演示文稿、电子表格和文档的能力。
给模型几张OpenAI演示模板的幻灯片,它能够按照原有的语气、布局和结构制作一份新的演示文稿。它也会处理任务中的信息取舍。OpenAI表示,Astra经过专门训练,会把重要上下文带入最终结果,减少重复已经完成工作的内容。
在任务指令不完整时,Astra也会判断什么时候应该问用户。如果缺少的信息会影响最终结果,它会提出针对性问题。如果问题不影响主要方向,它可以继续工作并做出合理假设。在Codex中,即使用户暂时没有回复,模型也可以继续处理其他部分;遇到重大决策,则会等待用户确认。
Harvey应用研究主管尼科·格鲁普(Niko Grupen)表示,在早期法律任务测试中,Astra对文档和既有记录的区分更加清楚,也更容易发现没有证据支持的假设,并把信息缺口转化成具体的起草方案。
Jane StreetAI助手团队约翰·克雷佩齐(John Crepezzi)表示,Astra在内部编码测试中表现突出。用于代理式编码时,它的沟通方式更容易让开发者理解,生成的代码也需要更少的修改才能达到生产质量。
科学领域是另一块重点。FrontierMath Tier4 v2中,Astra得分80.5且正确率97.6%,GPT-5.6 Sol为83.0%;GPQA Diamond达到96.0%,GPT-5.6 Sol为94.6%。
Terminal-Bench Science0.1测试科学研究流程,包括数据分析、模拟和模型拟合。Astra达到64.6%,Claude Fable5.1为52.6%,GPT-5.6 Sol为22.4%。
OpenAI展示的科学应用中,Astra可以进入专业科学软件,检查测序质量、可视化遗传变异,并根据数据决定下一步分析方向。
科学推理与计算机操作结合之后,模型能够直接进入研究人员原本使用的软件环境中工作。
Epoch AI专门做能力评测的格雷格·伯纳姆(Greg Burnham)在发布会上将这次变化概括为一个时代结束、另一个时代开始。OpenAI则借此强调,Astra的价值已经从回答科学问题延伸到了直接参与科学工作流程。
03 能力越强,安全门槛也越高
Astra这次还有一个很特殊的部分:网络安全。
ExploitBench中,Astra达到100%,GPT-5.6 Sol为78.5%;ExploitGym中,Astra达到42.4%,GPT-5.6 Sol为30.3%。
OpenAI又建立了一个覆盖2026年6月至8月近期漏洞的内部测试。在这项测试中,Astra的任意代码执行率明显高于GPT-5.6 Sol,使用的输出Token也更少。测试过程中,Astra还发现了两个此前未知的零日漏洞,OpenAI表示已经向相关维护者披露。
SRE-Bench测试的是没有源代码时逆向软件二进制文件、理解其核心逻辑的能力。Astra单次尝试解决88.0%的任务,四次尝试达到99.2%,GPT-5.6 Sol分别为55.9%和68.7%。
能力提升也带来了新的安全要求。OpenAI称,Astra已经达到其网络安全准备框架中的关键阈值。模型能够发现此前未知的软件漏洞,也可能进一步形成漏洞利用链。
因此,Astra当前版本会拒绝执行更高级的网络安全任务,例如创建漏洞概念验证。OpenAI计划通过Daybreak逐步扩大可信防御者的访问范围,用于漏洞验证、恶意软件分析和检测工程等防御工作。
在对齐方面,OpenAI给出的数据也比较突出。内部计算机使用安全基准中,Astra的不当行为率为2.4%,GPT-5.6 Sol为22.0%;加入AutoReview后,Astra为1.8%,GPT-5.6 Sol为4.5%。内部规避基准中,Astra为0.00%,GPT-5.6 Sol为0.29%。
在ExploitGym蜜罐测试中,Astra为0%,GPT-5.6 Sol为48.2%。这项测试主要观察模型是否会因为任务困难而试图绕过限制。内部幻觉基准中,Astra为4.2%,GPT-5.6 Sol为12.2%。
OpenAI表示,Astra在理解任务边界、处理模糊指令和向用户说明自身能力方面都有改善。其能力幻觉出现概率约为GPT-5.6 Sol的三分之一。
不过,OpenAI也承认一个问题:模型能力越强,推理过程可能越难监控。首席科学家雅库布·帕乔基(Jakub Pachocki)认为,模型能够用更少的自然语言推理Token解决更复杂的问题,也意味着人类越来越难通过模型的文字推理过程判断它究竟在做什么。
因此,OpenAI在Astra部署中加入了未对齐监控。系统会检查模型的推理和行动,如果发现未经授权的行为,可以暂停任务。
这套机制也会带来实际影响。合法任务有时可能被减速、暂停甚至停止。ChatGPT或Codex中,用户可能需要确认后才能继续;API工作流中,被标记的任务可能直接停止。
Astra的发布因此出现了一个很现实的变化:AI开始获得更多电脑权限之后,企业需要关注的也从“模型会不会回答错”扩展到“模型能操作什么、能访问什么、什么时候必须停下来”。
OpenAI此次还提到,Astra是其第一个在Stargate基础设施上使用超过10万个DBU进行预训练的模型。OpenAI研究副总裁艾丹·克拉克(Aidan Clark)表示,Astra从预训练阶段的评估结果来看,相比此前模型的能力跃升超过了GPT-5.6 Sol相对于上一代模型的提升。
OpenAI把这种变化归因于大规模预训练和强化学习的结合,训练重点进一步转向连接信息、执行更长任务以及在复杂环境中持续工作。
04 更贵但“更会做事”
Astra的价格也出现了明显变化。
OpenAI API标准价格为每百万输入Token 10美元、每百万输出Token 50美元。GPT-5.6 Sol此前为每百万输入Token 4美元、每百万输出Token 20美元。输入和输出价格都提高了2.5倍。
缓存读写单独计费。OpenAI同时提供快速模式,速度最高达到标准处理的2.5倍,价格为标准模式的2倍。
单看Token价格,Astra显然更贵。但OpenAI希望企业换一种方式计算成本。布罗克曼认为,随着模型越来越像代理,单个Token多少钱已经很难准确反映真实成本。一个模型即使Token便宜,如果需要反复尝试、人工修正,最后完成一项任务的成本可能更高。
OpenAI给出的数据也在支持这个判断。Terminal-Bench Science0.1中,Astra达到64.6%,相比Claude Fable5.1的52.6%,预估API成本降低约31%。在低成本设置下,Astra得分61.1%,GPT-5.6 Sol最佳结果为22.4%,预估API成本降低约27%。
BenchCAD中,Astra达到95.9%,预估API成本比GPT-5.6 Sol低约43%,比Claude Fable5.1低约86%。Terminal-Bench4.0中,Astra达到57.9%,GPT-5.6 Sol为37.3%,Claude Fable5.1为55.8%。OpenAI估算,单任务成本分别低约9%和63%。
第三方测评机构Artificial Analysis的数据则给出了另一面。
GPT-6 Astra在Artificial Analysis Intelligence Index中得分61.2,与GPT-5.6 Sol的60.9接近,但输出Token约减少10%。由于价格上涨2.5倍,单任务成本反而比GPT-5.6 Sol高约75%。
在Artificial Analysis Coding Agent Index中,Astra得分67.0,与Claude Fable5的67.2、Claude Opus5的68.1接近。Artificial Analysis认为,在Codex环境下,Astra完成任务所需的Token明显减少,在最高努力程度下,每项任务的成本与GPT-5.6 Sol接近;相比Claude Fable5,完成同类任务的成本不到一半。
不过,Astra也并非所有测试都领先。Artificial Analysis数据显示,它在GDPval-AA v2中出现约80个Elo的下降,在τ³-Banking、SciCode和AA-LCR等测试中也出现一定退步。Humanity's Last Exam则提升约6分。
这也是Astra发布中一个值得注意的地方。OpenAI这次没有公布GDPval的Astra成绩。GDPval本身就是OpenAI用于衡量现实经济工作表现的测试,覆盖44个职业、1320项任务,包括法律简报、工程设计、电子表格、演示文稿、客户支持和护理计划等。
从Astra此次展示的能力来看,GDPval与它所强调的专业工作场景有较强关联,但OpenAI这次没有把这项成绩放进主要发布材料。
因此,Astra的现实工作能力目前更多通过Agents' Last Exam、BenchCAD、AutomationBench、内部设计任务和数据科学任务等结果来体现。
最终,Astra能不能成为企业真正愿意长期使用的AI员工,还要看它完成实际任务时的成本、速度、准确率以及人工介入次数。
至于Astra到底是不是AGI,布罗克曼给出的答案并不回避。他认为,AGI本身没有一个所有人都认可的标准,Astra是否算作AGI可以继续讨论。但如果一个系统已经能够在浏览器、电脑操作、编程、数学、科学、法律和其他专业工作中承担大量任务,那么称其进入AGI时代并不牵强。
OpenAI首席执行官山姆·奥特曼(Sam Altman)也把Astra描述为开启新一代创业、科学发现和创造的模型。
特约编译金鹿对本文亦有贡献
据 Catcher Predict 监测,预测市场 Polymarket 上“Milwaukee Brewers vs. Chicago Cubs”事件中,子市场 “Milwaukee Brewers vs. Chicago Cubs” 的 “Milwaukee Brewers” 选项胜率发生剧烈波动,由 1 小时前的 54.5% 暴跌至当前的 32.5%(波动幅度达 22%)。请注意相关突发消息影响。
据 Catcher Predict 监测,预测市场 Polymarket 上“Milwaukee Brewers vs. Chicago Cubs”事件中,子市场 “Milwaukee Brewers vs. Chicago Cubs” 的 “Milwaukee Brewers” 选项胜率发生剧烈波动,由 1 小时前的 54.5% 暴跌至当前的 32.5%(波动幅度达 22%)。请注意相关突发消息影响。
Basetern 成立 Base Labs,专注开源 AI 研究ChainCatcher 消息,Base Labs 宣布成立,该机构为专注推进开源 AI 的独立研究组织。其表示相信健康、开放的前沿模型生态,并将以开放方式开展科学研究。 Base Labs 将开展持续学习、强化学习科学及模型全生命周期学习机制的蓝天研究,并公开分享全部实验与配方;建设 BaseHub Data Foundry,提供开放强化学习环境、训练数据与真实世界基准;通过持续后训练提升开源模型的能力、安全性与对齐水平,并部署前沿安全栈;同时开展模型性能研究,以降低成本并提升表现。 该机构强调此为使命驱动的研究工作而非商业产品,目前正在招聘工程师、研究人员及研究学者。

Basetern 成立 Base Labs,专注开源 AI 研究

ChainCatcher 消息,Base Labs 宣布成立,该机构为专注推进开源 AI 的独立研究组织。其表示相信健康、开放的前沿模型生态,并将以开放方式开展科学研究。
Base Labs 将开展持续学习、强化学习科学及模型全生命周期学习机制的蓝天研究,并公开分享全部实验与配方;建设 BaseHub Data Foundry,提供开放强化学习环境、训练数据与真实世界基准;通过持续后训练提升开源模型的能力、安全性与对齐水平,并部署前沿安全栈;同时开展模型性能研究,以降低成本并提升表现。
该机构强调此为使命驱动的研究工作而非商业产品,目前正在招聘工程师、研究人员及研究学者。
ເຂົ້າສູ່ລະບົບເພື່ອສຳຫຼວດເນື້ອຫາເພີ່ມເຕີມ
ເຂົ້າຮ່ວມກຸ່ມຜູ້ໃຊ້ຄຣິບໂຕທົ່ວໂລກໃນ Binance Square.
⚡️ ໄດ້ຮັບຂໍ້ມູນຫຼ້າສຸດ ແລະ ທີ່ມີປະໂຫຍດກ່ຽວກັບຄຣິບໂຕ.
💬 ໄດ້ຮັບຄວາມໄວ້ວາງໃຈຈາກຕະຫຼາດແລກປ່ຽນຄຣິບໂຕທີ່ໃຫຍ່ທີ່ສຸດໃນໂລກ.
👍 ຄົ້ນຫາຂໍ້ມູນເຊີງເລິກທີ່ແທ້ຈາກນັກສ້າງທີ່ໄດ້ຮັບການຢືນຢັນ.
ອີເມວ / ເບີໂທລະສັບ
ແຜນຜັງເວັບໄຊ
ການຕັ້ງຄ່າຄຸກກີ້
T&Cs ແພລັດຟອມ