返回 AI Pulse
TAG COLLECTION

\bGPT\b

所有带有「\bGPT\b」标签的 AI 情报。

34 条情报
X.com08/22 22:33商业动态

四个模型。三个任务。零次修改。

四个模型。三个任务。零次修改。 一开始一切看起来都一样。但仅一个提示之后,差异就显而易见了。 GPT-5.6、Claude Opus 5、Qwen 3.8 Max 和 Grok 4.6 需要构建一个高端产品页面、一款可玩的浏览器游戏,以及一个动画雨夜城市场景

X.com08/19 00:03基础设施

Anthropic 工程师 Andrej Karpathy 发布了一份完整的 6 小时指南《LLM 与 Tokenizer 简介及深入解析》: • 00:00 - LLM 简介 • 00...

Anthropic 工程师 Andrej Karpathy 发布了一份完整的 6 小时指南《LLM 与 Tokenizer 简介及深入解析》: • 00:00 - LLM 简介 • 00:59:28 - LLM 深入解析(Karpathy 方法) • 03:31:43 - 从零开始构建 GPT Tokenizer 这门 Karpathy 课程将取代

X.com08/19 00:03商业动态

我对 GPT-4o、Claude 5 和 Grok 4.6 进行了 10 个提示词的盲测。

我对 GPT-4o、Claude 5 和 Grok 4.6 进行了 10 个提示词的盲测。 同样的任务。没有标签。只看输出。 结果: > 3 项任务:GPT-4o 获胜 > 4 项任务:Claude 5 获胜 > 3 项任务:Grok 4.6 获胜 基准测试上只有 2 分的差距。我的测试证实了这一点。 模型已不再是决定性因素。 你的

X.com08/17 00:20Agent

GPT-5.6 Sol 的 100 万(1M)上下文现已在 Codex 中可用。此前这仅适用于 API 密钥,但我们刚刚切换了开关,现在通过 ChatGPT 账户使用也同样有效。同样的警...

GPT-5.6 Sol 的 100 万(1M)上下文现已在 Codex 中可用。此前这仅适用于 API 密钥,但我们刚刚切换了开关,现在通过 ChatGPT 账户使用也同样有效。同样的警告仍然适用:当前上下文长度之所以是默认值,是有原因的,我们已将其调优至接近完美。但选择权在你。

X.com08/17 00:20Agent

以下是如何在 Codex for GPT-5.6 Sol 中启用 100 万 token 的上下文窗口。尽管我们已针对性能和成本将 Codex 的上下文限制调整为最佳设置,但这是一种常见...

以下是如何在 Codex for GPT-5.6 Sol 中启用 100 万 token 的上下文窗口。尽管我们已针对性能和成本将 Codex 的上下文限制调整为最佳设置,但这是一种常见需求,因此在此记录。更大的上下文窗口可让 Codex 保留

X.com08/12 00:34产品更新

deepseek 马上发布code版本,可以直接调用工具跟执行 马上国内可以调用电脑的版本就出来了 按照deepseek的便宜价格,应该会抢很大一部分GPT 的市场 目前公众号已经注册了...

deepseek 马上发布code版本,可以直接调用工具跟执行 马上国内可以调用电脑的版本就出来了 按照deepseek的便宜价格,应该会抢很大一部分GPT 的市场 目前公众号已经注册了,马上开始招测试用户

X.com08/11 19:10Agent

.

. @Toyota built their R&D GPT on Deep Agents to help employees search years of paint, seat, and manufacturing research with a single command. Here's their story.

X.com08/11 00:32安全治理

do you understand what OpenAI just did?

do you understand what OpenAI just did? built a hacking-grade AI, then locked it behind an approval process for “trusted defenders” only it’s called Daybreak, and the headline model is GPT-5.6-Cyber. the numbers tell the

X.com08/10 21:47商业动态

Developers weigh in on OpenAI's GPT-5.6 Sol, from database audits to Erdős problem solving, a...

Developers weigh in on OpenAI's GPT-5.6 Sol, from database audits to Erdős problem solving, as it takes on Anthropic's Claude Opus 5.

X.com08/09 19:27基础设施

Fable 5 在定义不明确的功能构建方面表现出色 GPT 5.6 Sol 擅长大多数繁重的主力任务 Grok 4.5 在 Token 效率至关重要的场景(例如 PR 审查)中表现出众 ...

Fable 5 在定义不明确的功能构建方面表现出色 GPT 5.6 Sol 擅长大多数繁重的主力任务 Grok 4.5 在 Token 效率至关重要的场景(例如 PR 审查)中表现出众 Opus 5 GPT 5.6 Luna Max 以低得多的成本达到了 Sol 80% 的水平

X.com08/09 00:08商业动态

翻到一条六年前发的、体验 GPT-3 后的推文,没想到这一晃就六年了,这下真的开始慌了。

翻到一条六年前发的、体验 GPT-3 后的推文,没想到这一晃就六年了,这下真的开始慌了。

X.com08/08 23:46商业动态

I just realized I will be in San Francisco again on Sep 30th and that this is the exact date ...

I just realized I will be in San Francisco again on Sep 30th and that this is the exact date I predicted I would turn more bullish on OpenAI than Anthropic maybe they delay GPT-6 until DevDay on Sep 29th, which could tec

X.com08/02 23:46Agent

1) 相同型号(GPT 5.6 Sol @ medium) 2) 相同环境(ubuntu 26.04) 3) 相同的代理任务 4) 相同的结果 3) 不同的 token 使用量

1) 相同型号(GPT 5.6 Sol @ medium) 2) 相同环境(ubuntu 26.04) 3) 相同的代理任务 4) 相同的结果 3) 不同的 token 使用量

X.com08/02 23:31基础设施

GPT-5.4 完整版在 xhigh 下得分 51,正好是今天 Luna max 的水平。GPT-5.4 的价格是 2.50/15 美元;Luna 现在的价格是 0.20/1.20 美元...

GPT-5.4 完整版在 xhigh 下得分 51,正好是今天 Luna max 的水平。GPT-5.4 的价格是 2.50/15 美元;Luna 现在的价格是 0.20/1.20 美元。换句话说,大约四个月后,OpenAI 以约十三分之一的 token 价格出售三月份的完整旗舰智能。

X.com08/02 23:02商业动态

这太疯狂了,我刚刚给了Kimi K3、Grok 4.5、GPT 4.6 Sol和Claude Opus 5一个起始提示,然后让它们自己完成绘画。

这太疯狂了,我刚刚给了Kimi K3、Grok 4.5、GPT 4.6 Sol和Claude Opus 5一个起始提示,然后让它们自己完成绘画。 我还告诉它们要以自己的方式发挥创意。 这就是结果,说实话,我真的无法决定哪个最棒。

X.com08/02 22:46商业动态

luna max = sol medium gpt-5.6 luna 在最大推理设置下,基本上与 sol 在中等设置下的智能相同,而价格比 sol 便宜 25 倍。

luna max = sol medium gpt-5.6 luna 在最大推理设置下,基本上与 sol 在中等设置下的智能相同,而价格比 sol 便宜 25 倍。

X.com08/01 00:01商业动态

哈哈,他们差了好几个数量级。他们最好的AI大概相当于什么,GPT 3.5?

哈哈,他们差了好几个数量级。他们最好的AI大概相当于什么,GPT 3.5?

X.com07/29 20:46商业动态

他们不一定需要顶级的DRAM,如果他们的模型经过充分优化,性能可以接近Claude、GPT等美国领先AI模型。美国正在用原始算力取代效率。另外,中国擅长复制和大规模生产廉价物品。

他们不一定需要顶级的DRAM,如果他们的模型经过充分优化,性能可以接近Claude、GPT等美国领先AI模型。美国正在用原始算力取代效率。另外,中国擅长复制和大规模生产廉价物品。

X.com07/27 00:03商业动态

这个视频让AI排行榜看起来毫无用处。三个前沿模型得到了相同的提示。每个模型赢了一场不同的游戏。Opus 5构建了最丰富的世界:多样的地形、随风飘扬的旗帜、单位动画和击中反应。根据...,...

这个视频让AI排行榜看起来毫无用处。三个前沿模型得到了相同的提示。每个模型赢了一场不同的游戏。Opus 5构建了最丰富的世界:多样的地形、随风飘扬的旗帜、单位动画和击中反应。根据...,GPT-5.6 Sol拥有最好的用户界面。

X.com07/25 00:47商业动态

Claude Opus 5 以四分之三的价格在艰难的3D编码测试中击败了 Claude Fable 5。

Claude Opus 5 以四分之三的价格在艰难的3D编码测试中击败了 Claude Fable 5。 由 @thehypedotnews 进行的酷炫实验——opus 5 对比 fable 5 对比 gpt 5.6 sol 对比 kimi k3 opus 5 生成了工程最优且视觉最令人信服的 Three.js 结果 不禁疑惑为什么有人甚至会

X.com07/22 23:17商业动态

比哈尔邦的发展将加速数字化!在尊敬的首席部长Shri @samrat4bjp ji的领导下,NDA政府与Sarvam AI和Bharat GPT签署的重要谅解备忘录将推动开发适合比哈尔邦...

比哈尔邦的发展将加速数字化!在尊敬的首席部长Shri @samrat4bjp ji的领导下,NDA政府与Sarvam AI和Bharat GPT签署的重要谅解备忘录将推动开发适合比哈尔邦需求的本地化AI模型。

X.com07/22 22:47商业动态

MoE是Mixture of Experts的缩写(中文意为混合专家模型)。这是一种特殊的神经网络架构,现在最好的模型基本上都采用这种结构。例如Fable5,再比如GPT 5.6 sol...

MoE是Mixture of Experts的缩写(中文意为混合专家模型)。这是一种特殊的神经网络架构,现在最好的模型基本上都采用这种结构。例如Fable5,再比如GPT 5.6 sol等。让我们一起学习MoE是什么。

X.com07/22 22:47Agent

最近发现了一个实用的开源项目:OpenCodex。它让Codex不再局限于GPT模型,还可以接入Kimi、Grok、GLM等其他大模型。一次配置后,原有的Codex应用和工作流基本不受影响。

最近发现了一个实用的开源项目:OpenCodex。它让Codex不再局限于GPT模型,还可以接入Kimi、Grok、GLM等其他大模型。一次配置后,原有的Codex应用和工作流基本不受影响。

X.com07/22 20:32Agent

当您配置以下5项内容时,HERMES代理的实用性将提升10倍。每项配置仅需5分钟。大多数用户从未触及这些设置。

当您配置以下5项内容时,HERMES代理的实用性将提升10倍。每项配置仅需5分钟。大多数用户从未触及这些设置。 1. 正确的模型 一个模型应对所有任务 = 对大多数任务而言都是错误的模型。 GPT-5.6 Sol:最强推理能力。日常首选。通过您的访问权限获取。

X.com07/19 20:47商业动态

天哪,AI竞赛简直疯了。有人让GPT-5.6 Sol和Fable 5正面交锋——相同提示,各一次机会。任务:构建一个完整的《地铁跑酷》克隆版。两者都成功了。无尽跑酷、躲避交通、收集金币、...

天哪,AI竞赛简直疯了。有人让GPT-5.6 Sol和Fable 5正面交锋——相同提示,各一次机会。任务:构建一个完整的《地铁跑酷》克隆版。两者都成功了。无尽跑酷、躲避交通、收集金币、加速坡道——全套功能。两个前沿模型。

X.com07/01 00:46基础设施

atomic[.]chat,一款本地运行LLM的桌面应用,对Claude Sonnet 5、Claude Opus 4.8、Claude Sonnet 4.6和GPT 5.5进行了一项极...

atomic[.]chat,一款本地运行LLM的桌面应用,对Claude Sonnet 5、Claude Opus 4.8、Claude Sonnet 4.6和GPT 5.5进行了一项极具启发性的对比。 Claude Sonnet 5在3个物理编码演示中与GPT 5.5持平,成本降低6倍。 同时使用了最少的token数量。

X.com06/30 23:16商业动态

LONGCAT 在真实物理任务上刚刚匹配了 OPUS 4.8 和 GPT 5.5,而且完全免费。Atomic Chat 对四个模型进行了相同的测试,构建了具有真实物理效果的 HTML5 ...

LONGCAT 在真实物理任务上刚刚匹配了 OPUS 4.8 和 GPT 5.5,而且完全免费。Atomic Chat 对四个模型进行了相同的测试,构建了具有真实物理效果的 HTML5 Canvas 场景,包括大炮对砖墙、保龄球瓶、龙卷风吸起物体。Opus 4.8 花费 0.48 美元,而 GPT...

X.com06/29 21:31开源项目

GLM 5.2 刚刚在真实构建中击败了Claude 疯狂的部分是什么?

GLM 5.2 刚刚在真实构建中击败了Claude 疯狂的部分是什么? 它是开源的。 测试结果: → GLM 5.2 构建了最佳游戏 → Claude Opus 4.8 碾压了轨道地图 → GPT 5.5 通过一个提示构建了可玩的颜色链游戏 真正重要的是: ✓ GLM 5.2 最具创意

X.com06/14 20:15Agent

我们更新了Artificial Analysis编码Agent指数,用Datacurve的DeepSWE基准取代了SWE-Bench Pro——这一换位使得搭载GPT-5.5(xhigh...

我们更新了Artificial Analysis编码Agent指数,用Datacurve的DeepSWE基准取代了SWE-Bench Pro——这一换位使得搭载GPT-5.5(xhigh)的Codex超越了搭载Opus 4.8(max)的Claude Code,而新发布的Claude Code中的Claude Fable 5(max)首次登顶