返回 AI Pulse
TAG COLLECTION

基础设施

所有带有「基础设施」标签的 AI 情报。

77 条情报
X.com08/30 23:17基础设施

还在为顶尖大模型支付全价吗?Jalapeno Cloud 限时特惠:GLM-5.3-Flash 半价,DeepSeek V4 Flash 0731 二折——直接来自我们的自有 GPU 集群。

还在为顶尖大模型支付全价吗?Jalapeno Cloud 限时特惠:GLM-5.3-Flash 半价,DeepSeek V4 Flash 0731 二折——直接来自我们的自有 GPU 集群。

X.com08/30 23:17基础设施

"Claude 使用额度已达上限。你的额度将在晚上7点重置。" 每天。每天都是。

"Claude 使用额度已达上限。你的额度将在晚上7点重置。" 每天。每天都是。 我差点花 $200 买 Max。然后我看到了这段 18 分钟的视频 98.5% 的 token 被浪费了 你不是在为回答付费。你是在为 Claude 把你的整个代码库重读 30 次付费。 我花了

X.com08/30 20:06基础设施

傅里叶变换运行在每一块GPU、每一块WiFi芯片、每一台MRI扫描仪内部——而它只不过是乘法和积分。

傅里叶变换运行在每一块GPU、每一块WiFi芯片、每一台MRI扫描仪内部——而它只不过是乘法和积分。 这个公式看起来像个怪物。希腊字母、虚数、从负无穷到正无穷的积分。大多数人看到它,

OpenAI08/26 08:00基础设施

Jalapeño是OpenAI推出的一款定制推理芯片,可实现更快、更节能的AI推理,并为现代模型带来更高的吞吐量和更低的延迟。

Jalapeño是OpenAI推出的一款定制推理芯片,可实现更快、更节能的AI推理,并为现代模型带来更高的吞吐量和更低的延迟。

X.com08/24 19:34基础设施

Jane Street 可以每年支付给一名 22 岁的年轻人超过 50 万美元,而你却可以免费开始学习这项技能。

Jane Street 可以每年支付给一名 22 岁的年轻人超过 50 万美元,而你却可以免费开始学习这项技能。 这项技能就是知道如何给不确定性赋予一个数值。 印度理工学院哈拉格普尔分校的教授 Mrityunjoy Chakraborty 有一个免费的概率论系列讲座,从公理开始逐步构建。

X.com08/22 20:47基础设施

Claude Fable 5 机器人正在取代手动交易者 在约6小时内为 Polymarket 构建了最简单的套利机器人 成本:500万代币 当前会话盈亏:+$2,793.36 它仍然只做...

Claude Fable 5 机器人正在取代手动交易者 在约6小时内为 Polymarket 构建了最简单的套利机器人 成本:500万代币 当前会话盈亏:+$2,793.36 它仍然只做一件事: 当 YES + NO < $1 时开仓交易。 仅此而已。 但它现在能捕捉到套利机会

X.com08/22 20:02基础设施

EIS 之前:CPU 节点,自行管理,每个模型一个。

EIS 之前:CPU 节点,自行管理,每个模型一个。 EIS 之后:1 个 GPU 加速集群,由 Elastic 管理。 向量搜索和语义重排序都运行在您自行配置的 CPU 节点上。 模型越多,意味着需要运维的基础设施越多。 Elastic Inference Service(EIS)

X.com08/22 19:03基础设施

Google DeepMind 在12分钟内解释了思维模型 盐和糖的例子杀死了 Best-of-N:一次标签贴错,就会烤出100个糟糕的蛋糕。出现频率无法修复系统性错误。要么引入验证器,...

Google DeepMind 在12分钟内解释了思维模型 盐和糖的例子杀死了 Best-of-N:一次标签贴错,就会烤出100个糟糕的蛋糕。出现频率无法修复系统性错误。要么引入验证器,要么完蛋。 9个还是27个苹果:单遍推理失败了,思维链(CoT)通过了。没人问这条 CoT 消耗了多少 token。

X.com08/20 23:17基础设施

GamerHash AI 让您可以在自己的 GPU 上生成视频、图像和聊天回复。所有内容均在本地运行,因此无需付费,也无人监视。

GamerHash AI 让您可以在自己的 GPU 上生成视频、图像和聊天回复。所有内容均在本地运行,因此无需付费,也无人监视。 但您的 GPU 还有第二招。 完成创作后,打开 Earn 模块。开发者正在

X.com08/20 23:17基础设施

芬兰。泰国。澳大利亚。印度及更多地区。边缘端 RTX GPU,每小时 $0.10 起。在 Theta EdgeCloud 上部署。

芬兰。泰国。澳大利亚。印度及更多地区。边缘端 RTX GPU,每小时 $0.10 起。在 Theta EdgeCloud 上部署。

OpenAI08/20 08:00基础设施

Replit 推出由 GPT-5.6 Luna 驱动的免费模式,让任何人都能将想法转化为可运行的软件,而无需担心 token 费用。

Replit 推出由 GPT-5.6 Luna 驱动的免费模式,让任何人都能将想法转化为可运行的软件,而无需担心 token 费用。

X.com08/19 00:03基础设施

NASA 拒绝了我们的申请。于是我们造了自己的座舱。

NASA 拒绝了我们的申请。于是我们造了自己的座舱。 在 GamerHash AI 中输入一个提示词,你的 GPU 就会逐帧渲染升空画面。完全免费。

X.com08/19 00:03基础设施

Anthropic 工程师 Andrej Karpathy 发布了一份完整的 6 小时指南《LLM 与 Tokenizer 简介及深入解析》: • 00:00 - LLM 简介 • 00...

Anthropic 工程师 Andrej Karpathy 发布了一份完整的 6 小时指南《LLM 与 Tokenizer 简介及深入解析》: • 00:00 - LLM 简介 • 00:59:28 - LLM 深入解析(Karpathy 方法) • 03:31:43 - 从零开始构建 GPT Tokenizer 这门 Karpathy 课程将取代

X.com08/19 00:03基础设施

TypeGPU 中的深度感知光注入 我把一个 448×448 的单目深度模型降到了约 8 毫秒(在我的 M4 Pro 上,约 250 次调度总计),这足够快了,可以实时使用 :D 由于推...

TypeGPU 中的深度感知光注入 我把一个 448×448 的单目深度模型降到了约 8 毫秒(在我的 M4 Pro 上,约 250 次调度总计),这足够快了,可以实时使用 :D 由于推理直接用 TypeGPU 编写,我可以直接把深度缓冲注入到

X.com08/17 00:20基础设施

《华尔街日报》的标题选择很有意思。

《华尔街日报》的标题选择很有意思。 英伟达与6家金融公司已签署备忘录,拟通过独立的计算融资平台调动超过5000亿美元的第三方资本。 — 一旦华尔街接受GPU作为可回收抵押品,英伟达

X.com08/17 00:20基础设施

别再为 AI 多付钱了。转而节省 30%。

别再为 AI 多付钱了。转而节省 30%。 https:// CheaperInference.com 以折扣价提供大多数领先的 AI 模型。我们以更低的价格购买未使用的消费承诺,因此您支付更少。 投入 $5,我们将额外加 $10 —— 让您以 $15 开始使用。

X.com08/17 00:20基础设施

天时地利:许多新兴云服务商花了多年时间挖掘加密货币,随后人工智能横空出世,将他们的电力权、数据中心和GPU变成了科技领域最炙手可热的资产之一。

天时地利:许多新兴云服务商花了多年时间挖掘加密货币,随后人工智能横空出世,将他们的电力权、数据中心和GPU变成了科技领域最炙手可热的资产之一。 25个季度以来,CoreWeave的季度收入已经超过了Azure、AWS和Google Cloud。

OpenAI08/14 08:00基础设施

预览 Ultrafast,一项全新的 OpenAI API 服务层级,可让 GPT-5.6 Sol 运行速度提升高达 14 倍。由 Cerebras 提供支持,每秒可输出多达 750 个...

预览 Ultrafast,一项全新的 OpenAI API 服务层级,可让 GPT-5.6 Sol 运行速度提升高达 14 倍。由 Cerebras 提供支持,每秒可输出多达 750 个 token。

X.com08/13 00:01基础设施

Cheaper Inference 正在以 7 折优惠出售大多数主流模型的 API 访问权限。

Cheaper Inference 正在以 7 折优惠出售大多数主流模型的 API 访问权限。 http:// cheaperinference.com /?twclid=2drokxbgyzpbftxp1birzo8ov3

X.com08/12 00:45基础设施

Big announcement from @MistralAI today: European Compute Units Regional inference Third-party...

Big announcement from @MistralAI today: European Compute Units Regional inference Third-party model support starting with GLM 5.2 @MistralAI is bringing together the inference infrastructure, open models, and long-term c

X.com08/11 00:01基础设施

We identified the source of the issue affecting creation of fine-grained personal access toke...

We identified the source of the issue affecting creation of fine-grained personal access tokens and have applied a mitigation. Users should now be able to create new fine-grained tokens successfully. We are continuing to

X.com08/10 21:34基础设施

Microsoft reportedly plans to unveil Maia 300, its custom AI silicon.

Microsoft reportedly plans to unveil Maia 300, its custom AI silicon. Also it wants TSMC capacity for 300,000 Maia 300 chips for future delivery. Microsoft says the chip delivers over 30% more tokens per dollar than the

X.com08/10 19:32基础设施

New CSS Attacks Expose Webmail Users to Passord and Token Theft https:// cysecurity.news/2026...

New CSS Attacks Expose Webmail Users to Passord and Token Theft https:// cysecurity.news/2026/08/new-cs s-attacks-expose-webmail-users-to.html?utm_source=dlvr.it&utm_medium=twitter … #AIEmailAttacks #AuthenticationTokens

X.com08/09 19:27基础设施

Fable 5 在定义不明确的功能构建方面表现出色 GPT 5.6 Sol 擅长大多数繁重的主力任务 Grok 4.5 在 Token 效率至关重要的场景(例如 PR 审查)中表现出众 ...

Fable 5 在定义不明确的功能构建方面表现出色 GPT 5.6 Sol 擅长大多数繁重的主力任务 Grok 4.5 在 Token 效率至关重要的场景(例如 PR 审查)中表现出众 Opus 5 GPT 5.6 Luna Max 以低得多的成本达到了 Sol 80% 的水平

X.com08/08 20:01基础设施

FreeKimi K3 has been extended through August 12!

FreeKimi K3 has been extended through August 12! Quick setup: → http:// tokenrouter.com /?twclid=29rsf4jjnwwdpgtty0qfd5lnjx → get API key → model: moonshotai/kimi-k3-free → base URL: http:// api.tokenrouter.com/v1 ?twcli

X.com08/02 23:46基础设施

不要浪费2年时间去学习构建像Claude和ChatGPT这样的LLM。

不要浪费2年时间去学习构建像Claude和ChatGPT这样的LLM。 斯坦福大学刚刚发布了一门2小时的课程,讲解如何从头构建LLM。 • 00:00 - LLM分词 • 25:44 - LLM如何解码用户提示 • 35:40 - LLM的训练流程 • 1:16:47 - LLM架构从

X.com08/02 23:46基础设施

只是提醒一下: OpenAI计划中的大多数数据中心尚未建成。

只是提醒一下: OpenAI计划中的大多数数据中心尚未建成。 NVIDIA的Rubin GPU预计将从2026年第四季度开始将推理成本降低约90%。 此外,OAI自家的芯片有望使推理成本比Vera Rubin低50%,并计划推出。

X.com08/02 23:31基础设施

GPT-5.4 完整版在 xhigh 下得分 51,正好是今天 Luna max 的水平。GPT-5.4 的价格是 2.50/15 美元;Luna 现在的价格是 0.20/1.20 美元...

GPT-5.4 完整版在 xhigh 下得分 51,正好是今天 Luna max 的水平。GPT-5.4 的价格是 2.50/15 美元;Luna 现在的价格是 0.20/1.20 美元。换句话说,大约四个月后,OpenAI 以约十三分之一的 token 价格出售三月份的完整旗舰智能。

X.com08/02 22:04基础设施

Modular 平台通过开放、完全集成的库和工具套件,统一了 AI 开发与部署,以支持模型服务和 GenAI 扩展。

Modular 平台通过开放、完全集成的库和工具套件,统一了 AI 开发与部署,以支持模型服务和 GenAI 扩展。 - 来自 6,000 多名贡献者的超过 450,000 行代码。 - 包括 MAX GPU 和 CPU 内核,以及 Mojo 标准库。

X.com08/01 23:46基础设施

管理加密投资组合不应该复杂。这就是为什么我在查看 @alloxdotai AlloX 使用 AI 来分析单个代币,用户可以选择自动的 一种通过数据驱动的洞察来保持多元化和投资的智能方式。

管理加密投资组合不应该复杂。这就是为什么我在查看 @alloxdotai AlloX 使用 AI 来分析单个代币,用户可以选择自动的 一种通过数据驱动的洞察来保持多元化和投资的智能方式。 #Allox #Crypto #aigirlep1 #Web3 #DEFINITION

X.com07/31 21:33基础设施

不同意,这仍然是AI垃圾。完全衍生产物,但乍一看视觉上很有趣。

不同意,这仍然是AI垃圾。完全衍生产物,但乍一看视觉上很有趣。 花费数百美元的代币来复制《我的世界》或《无人深空》或随机的第一人称射击游戏,技术上令人惊叹,但缺乏想象力。 AI真正的创造力即将到来,但尚未实现。

X.com07/29 22:32基础设施

最强的货币锚是当时全球经济必须用来运作的任何东西。现在这是一个全栈经济,以必要的生产成本做事,而不是黄金、石油、AI输入/输出代币。

最强的货币锚是当时全球经济必须用来运作的任何东西。现在这是一个全栈经济,以必要的生产成本做事,而不是黄金、石油、AI输入/输出代币。

X.com07/29 00:02基础设施

杰基·西曼斯基 @SzymanskiJackie · 3小时前 inc.com 让位吧,无限带薪休假:硅谷新潮的必备AI福利 英伟达CEO黄仁勋提议为工程师提供AI使用的令牌预算。

杰基·西曼斯基 @SzymanskiJackie · 3小时前 inc.com 让位吧,无限带薪休假:硅谷新潮的必备AI福利 英伟达CEO黄仁勋提议为工程师提供AI使用的令牌预算。

X.com07/27 22:46基础设施

股票下跌,但我们在太空中的特斯拉未来从未像今天这样更有可能或更迫在眉睫。特斯拉立即创建并为新的MegaPod节点供电的能力,用于改进电网、分布式AI计算集群以处理地球上的推理问题,这是一...

股票下跌,但我们在太空中的特斯拉未来从未像今天这样更有可能或更迫在眉睫。特斯拉立即创建并为新的MegaPod节点供电的能力,用于改进电网、分布式AI计算集群以处理地球上的推理问题,这是一个巨大的AI。

X.com07/27 20:16基础设施

AI竞赛存在一个瓶颈 不是GPU。

AI竞赛存在一个瓶颈 不是GPU。 而是能源。 $KEEL 正围绕AI的基础设施层进行布局,涉及数据中心项目和庞大的电力管线。 大众在关注芯片制造商…… 聪明钱关注的是芯片所需之物。

X.com07/27 00:47基础设施

人们指责他伪造了这次Mac Mini的电池测试 直到他证明它在运行本地AI时消耗的电力比台灯还少 大多数开发者认为运行本地大语言模型需要一个噪音大、直接从墙上消耗500瓦电力的价值300...

人们指责他伪造了这次Mac Mini的电池测试 直到他证明它在运行本地AI时消耗的电力比台灯还少 大多数开发者认为运行本地大语言模型需要一个噪音大、直接从墙上消耗500瓦电力的价值3000美元的GPU设备。 这位创作者连接了一个

X.com07/27 00:31基础设施

通用AI价值正在流入链上AI。中国开源权重实验室 → 推理提供者 → 智能路由器。Venice正在抢占更多代币份额,DIEM二级市场正在建立,去中心化消费者推理正在形成其结构性护城河。深入探索

通用AI价值正在流入链上AI。中国开源权重实验室 → 推理提供者 → 智能路由器。Venice正在抢占更多代币份额,DIEM二级市场正在建立,去中心化消费者推理正在形成其结构性护城河。深入探索

X.com07/26 20:31基础设施

OpenAI 签署了。谷歌签署了。英伟达签署了。Anthropic 没有。几天后,中国推出了 Kimi K3。

OpenAI 签署了。谷歌签署了。英伟达签署了。Anthropic 没有。几天后,中国推出了 Kimi K3。 巧合?也许吧。 但这个时机再有趣不过了。 Kimi K3 是首个开源的 2.8T 参数 MoE 模型,具有 1M token 的上下文窗口、原生视觉,以及一个

X.com07/23 22:03基础设施

预训练的ViT以丰富、密集的细节观察世界。大多数策略在行动前将其池化为单一向量,丢弃了大部分信息。

预训练的ViT以丰富、密集的细节观察世界。大多数策略在行动前将其池化为单一向量,丢弃了大部分信息。 我们引入Patch Policy:一种最小的架构扩展,使基于transformer的策略能够直接处理密集的token,无需

X.com07/22 23:46基础设施

四张英特尔锐炫Pro B60显卡将本地AI PC转变为192GB显存池,用于处理单张GPU无法容纳的模型。对于运行周期性内部代码或文档任务的运维人员而言,租用容量在成为模型问题之前,首先...

四张英特尔锐炫Pro B60显卡将本地AI PC转变为192GB显存池,用于处理单张GPU无法容纳的模型。对于运行周期性内部代码或文档任务的运维人员而言,租用容量在成为模型问题之前,首先是一个调度问题。四张双板英特尔

X.com07/22 23:01基础设施

中国开发者将完整GPU绑在120美元迷你PC上,去年赚了19万美元,而他的前联合创始人却将A轮融资烧在了Anthropic账单上

中国开发者将完整GPU绑在120美元迷你PC上,去年赚了19万美元,而他的前联合创始人却将A轮融资烧在了Anthropic账单上

X.com07/22 23:01基础设施

一个2.8万亿参数的模型刚刚在人们真正付费的领域击败了封闭式AI:构建。据报道,Kimi K3在前端编码中排名第一,拥有100万token的上下文窗口,并能将一个提示转化为游戏、3D世界...

一个2.8万亿参数的模型刚刚在人们真正付费的领域击败了封闭式AI:构建。据报道,Kimi K3在前端编码中排名第一,拥有100万token的上下文窗口,并能将一个提示转化为游戏、3D世界、完整产品或仓库级工程。

X.com07/22 22:47基础设施

1966年,斯坦福大学建造了谢克——世界上第一个AI机器人。现代人工智能就在这里诞生。几乎没有人看过原始影像。没有GPU,没有神经网络,没有现代代码。只是一个1米高的轮式箱子,连接到房间...

1966年,斯坦福大学建造了谢克——世界上第一个AI机器人。现代人工智能就在这里诞生。几乎没有人看过原始影像。没有GPU,没有神经网络,没有现代代码。只是一个1米高的轮式箱子,连接到房间大小的主机上。它是在斯坦福大学建造的。

X.com07/21 23:47基础设施

56美元对比0.50美元。同样的百万个代币。一桶的成本是另一桶的112倍——而工作量可能只多20%。查马斯在CNBC上直言不讳地说:一桶“50美元的智能”旁边放着一桶1美元的。溢价如何悄...

56美元对比0.50美元。同样的百万个代币。一桶的成本是另一桶的112倍——而工作量可能只多20%。查马斯在CNBC上直言不讳地说:一桶“50美元的智能”旁边放着一桶1美元的。溢价如何悄然消失:第一步→竞争对手提供80-95%的质量。

X.com07/20 21:02基础设施

用人工智能获胜的人并非花费更多,而是花费更少。每个人都在谈论每月200美元的订阅费。几乎没有人谈论现在可用的数亿免费AI代币。最聪明的构建者不会从购买最昂贵的开始。

用人工智能获胜的人并非花费更多,而是花费更少。每个人都在谈论每月200美元的订阅费。几乎没有人谈论现在可用的数亿免费AI代币。最聪明的构建者不会从购买最昂贵的开始。

X.com07/19 20:47基础设施

一位23岁的开发者一次性花费4699美元,将每月850美元的AI成本削减,并将一台台式机变成了一个业务。

一位23岁的开发者一次性花费4699美元,将每月850美元的AI成本削减,并将一台台式机变成了一个业务。 每个人都在谈论更好的AI模型。 几乎没有人谈论拥有运行这些模型的计算机。 云GPU按你思考的每小时收费。 本地AI盒子

X.com07/19 20:47基础设施

一位谷歌AI工程师意外泄露了他的本地Obsidian知识库。内部——一个离线图谱,横跨18,000个相互关联的客户文件。18,000个知识节点。11,200个链接。0美元云令牌账单。打开...

一位谷歌AI工程师意外泄露了他的本地Obsidian知识库。内部——一个离线图谱,横跨18,000个相互关联的客户文件。18,000个知识节点。11,200个链接。0美元云令牌账单。打开OpenClaw工作区。屏幕显示一个Obsidian。

X.com07/02 00:46基础设施

THIS DEVELOPER ADMITS HE'S GPU POOR WITH A 4-YEAR-OLD RTX 3090 - AND TESTS EVERY VRAM TIER SO...

THIS DEVELOPER ADMITS HE'S GPU POOR WITH A 4-YEAR-OLD RTX 3090 - AND TESTS EVERY VRAM TIER SO YOU KNOW EXACTLY WHAT YOUR HARDWARE CAN DO RTX 3060 with 12GB vs AMD BC250 with 16GB - one is a dedicated GPU with extra CPU a

X.com07/01 23:16基础设施

温度0.5:最高概率标记占96.97%。

温度0.5:最高概率标记占96.97%。 温度2.0:同一标记占58.58%,相邻标记从1.5%跃升至20%。 你随意拖动的滑块会非线性地改变分布 在1889年的高尔顿板上分解了这一点

X.com07/01 21:33基础设施

一位31岁的布加勒斯特运营商将8块二手NVIDIA T4显卡塞进超微机箱,花费1847美元,如今每月向罗马尼亚Shopify商店提供推理服务,收费11240美元。

一位31岁的布加勒斯特运营商将8块二手NVIDIA T4显卡塞进超微机箱,花费1847美元,如今每月向罗马尼亚Shopify商店提供推理服务,收费11240美元。

X.com07/01 00:46基础设施

atomic[.]chat,一款本地运行LLM的桌面应用,对Claude Sonnet 5、Claude Opus 4.8、Claude Sonnet 4.6和GPT 5.5进行了一项极...

atomic[.]chat,一款本地运行LLM的桌面应用,对Claude Sonnet 5、Claude Opus 4.8、Claude Sonnet 4.6和GPT 5.5进行了一项极具启发性的对比。 Claude Sonnet 5在3个物理编码演示中与GPT 5.5持平,成本降低6倍。 同时使用了最少的token数量。

X.com06/30 21:16基础设施

一位29岁的丹佛开发者花42,000美元购买了一台NVIDIA H100设备,该设备去年新品售价为400,000美元,现在每月通过微调服务赚取43,200美元。伊桑29岁,在丹佛地下室办...

一位29岁的丹佛开发者花42,000美元购买了一台NVIDIA H100设备,该设备去年新品售价为400,000美元,现在每月通过微调服务赚取43,200美元。伊桑29岁,在丹佛地下室办公室的绿色熨衣板下工作,从桑尼韦尔一家AI初创公司赢得了一台NVIDIA HGX H100 8 GPU服务器。

X.com06/30 20:31基础设施

推理将彻底改变:Etched 发明了两种新方法,大幅提升计算成本、速度和每瓦效率:低电压推理(更多 FLOPs)和集群级内存(内存/带宽)。这种组合以超过 80% 的 MFU 运行万亿参...

推理将彻底改变:Etched 发明了两种新方法,大幅提升计算成本、速度和每瓦效率:低电压推理(更多 FLOPs)和集群级内存(内存/带宽)。这种组合以超过 80% 的 MFU 运行万亿参数模型。

X.com06/30 20:16基础设施

这位中国建造者将8块退役的Tesla P40显卡改造成了一台192GB的私人AI服务器,每月可运行5,760 GPU小时。00:06 他举起一块二手Tesla P40,身后还有七块,然后...

这位中国建造者将8块退役的Tesla P40显卡改造成了一台192GB的私人AI服务器,每月可运行5,760 GPU小时。00:06 他举起一块二手Tesla P40,身后还有七块,然后将整套设备安装在一个巨大的双路Xeon服务器机箱内。每块显卡

X.com06/30 19:16基础设施

Meta的PyTorch核心工程师在13分钟内将CUDA内核编写变成了一项运动——比1500美元的GPU编程训练营更胜一筹。分析内核→找到瓶颈→重写→基准测试→将优胜代码合并到PyTor...

Meta的PyTorch核心工程师在13分钟内将CUDA内核编写变成了一项运动——比1500美元的GPU编程训练营更胜一筹。分析内核→找到瓶颈→重写→基准测试→将优胜代码合并到PyTorch。这个循环就是开源社区现在的工作方式。

X.com06/30 19:16基础设施

你599美元的Mac Mini在关键性能上击败了3800美元的GPU。统一内存意味着模型只需加载一次,两个处理器从同一内存池读取数据。而价格翻倍的Windows机器仍需在RAM和VRAM...

你599美元的Mac Mini在关键性能上击败了3800美元的GPU。统一内存意味着模型只需加载一次,两个处理器从同一内存池读取数据。而价格翻倍的Windows机器仍需在RAM和VRAM之间复制数据,且性能受限。2015年的130美元Tesla M40。

X.com06/29 21:31基础设施

Dan Fu与Tri Dao共同撰写了FlashAttention。随后,他共同构建了Hyena、Monarch Mixer和ThunderKittens。如今,他是Together A...

Dan Fu与Tri Dao共同撰写了FlashAttention。随后,他共同构建了Hyena、Monarch Mixer和ThunderKittens。如今,他是Together AI的杰出研究员。在运行ChatGPT、Claude和Gemini的推理栈中,你可以找到四个核心组件。这一切,都源于同一个人,且始终处于你的关键路径上。

X.com06/29 21:16基础设施

3,999美元或4,699美元。同样的128GB。同样的本地推理。只是盒子上的标志不同。

3,999美元或4,699美元。同样的128GB。同样的本地推理。只是盒子上的标志不同。 AMD的Ryzen AI Halo开发者平台。NVIDIA的DGX Spark。两者都能本地运行大模型。两者都有128GB统一内存。同一类别,同一用途,相差700美元。 下面的视频编辑了Jensen

OpenAI06/29 08:17基础设施

OpenAI与博通联合推出Jalapeño,这是一款专为大型语言模型推理设计的定制AI芯片,旨在提升AI系统的性能、效率及扩展能力。

OpenAI与博通联合推出Jalapeño,这是一款专为大型语言模型推理设计的定制AI芯片,旨在提升AI系统的性能、效率及扩展能力。

X.com06/28 21:46基础设施

中国开发者每月花费2.2万美元,用80美元的PS5芯片自制显卡运行AI,而所有AI初创公司都在排队等待8个月的H100显卡。联想办公电脑。侧面伸出的AMD BC-250芯片。与索尼在PS...

中国开发者每月花费2.2万美元,用80美元的PS5芯片自制显卡运行AI,而所有AI初创公司都在排队等待8个月的H100显卡。联想办公电脑。侧面伸出的AMD BC-250芯片。与索尼在PS5中使用的相同芯片,现在为3个付费客户运行推理。硬件成本80美元。

X.com06/28 21:46基础设施

一位开发者通过插入一个AMD外置显卡,将一台2019年二手的Mac Pro改造成了一个35B参数的本地LLM服务器,总花费不到3000美元,使该设备达到了每秒52个token的处理速度。...

一位开发者通过插入一个AMD外置显卡,将一台2019年二手的Mac Pro改造成了一个35B参数的本地LLM服务器,总花费不到3000美元,使该设备达到了每秒52个token的处理速度。他发布了一段视频,显示Mac Pro放在桌子下面,一根雷电电缆连接到装有RX 6800的Paladin外置显卡扩展坞。

X.com06/28 21:33基础设施

将24块来自废弃加密矿机的BC250板卡集群成384GB推理池,每秒仅生成1个token,年电费5000美元。你地图上的零级漏洞无法扩展超过4个节点。

将24块来自废弃加密矿机的BC250板卡集群成384GB推理池,每秒仅生成1个token,年电费5000美元。你地图上的零级漏洞无法扩展超过4个节点。

X.com06/28 20:45基础设施

这位开发者运行着一个拥有维基百科规模知识库的完整本地AI——每月仅需支付3美元,而其他人却要支付300美元。开放式AI工作站,LCD显示屏实时显示GPU负载和内存使用情况,用于本地推理的...

这位开发者运行着一个拥有维基百科规模知识库的完整本地AI——每月仅需支付3美元,而其他人却要支付300美元。开放式AI工作站,LCD显示屏实时显示GPU负载和内存使用情况,用于本地推理的PCIe卡,以及一个显示知识图谱的显示器。

X.com06/25 22:35基础设施

所以我几乎加上了 - 家用 GPU 装备 这对于自给自足来说可能很好,但我仍然不认为本地 LLM 的东西在质量、性能(速度)或成本方面甚至无法接近云 让你的家自给自足是件好事,我有: -...

所以我几乎加上了 - 家用 GPU 装备 这对于自给自足来说可能很好,但我仍然不认为本地 LLM 的东西在质量、性能(速度)或成本方面甚至无法接近云 让你的家自给自足是件好事,我有: - 2x Tesla Powerwall (27

X.com06/25 22:15基础设施

我们展示了如何让法学硕士在潜在空间而不是人类语言中进行良好的交流。

我们展示了如何让法学硕士在潜在空间而不是人类语言中进行良好的交流。 #ICML2026 焦点(前 2%) 自回归潜在思想 -> KV 传递 -> 输入输出对齐 通过绕过解码将推理速度提高 4 倍以上,并将性能提高高达 14%。

X.com06/25 22:03基础设施

这位中国企业家建造了一个仓库规模的 GPU 农场,现在每月向人工智能初创公司提供 400 万美元的租金 沃尔玛大小的仓库中有 4,000 个 GPU - 电力合同和冷却已经就位 - 以及...

这位中国企业家建造了一个仓库规模的 GPU 农场,现在每月向人工智能初创公司提供 400 万美元的租金 沃尔玛大小的仓库中有 4,000 个 GPU - 电力合同和冷却已经就位 - 以及一个身高 6 英尺 6 英寸的操作员 以太坊将于 2022 年 9 月合并

X.com06/24 19:31基础设施

10,000 ASICS AT 100 DECIBELS BURN $1.6M/MO IN POWER.配备 5,000 个 GPU、85 DB 的同一仓库通过 AI 推理赚得 400 ...

10,000 ASICS AT 100 DECIBELS BURN $1.6M/MO IN POWER.配备 5,000 个 GPU、85 DB 的同一仓库通过 AI 推理赚得 400 万美元 100 decibels on the warehouse floor, workers wear industrial ear muffs all 8 hour shifts, you cannot hold a conversation 3

X.com06/23 19:45基础设施

每月 220 美元的 AI 账单。他想都没想就付了两年的钱。

每月 220 美元的 AI 账单。他想都没想就付了两年的钱。 然后一位客户问了一个问题,90 秒内拿走了 5,000 美元。 0点21分观看。他指着桌子下面的 GPU 的位置。 其中一台使用 RTX 3090。24GB VRAM。以 1,050 美元的价格购买二手货。

X.com06/18 20:15基础设施

Huggingface_hub v1.19.0 提供了受信任的发布者:通过 OIDC 令牌交换对 Hub 进行无密钥 CI/CD 身份验证。

Huggingface_hub v1.19.0 提供了受信任的发布者:通过 OIDC 令牌交换对 Hub 进行无密钥 CI/CD 身份验证。 CI 配置中不再有 HF_TOKEN 机密。这是它的工作原理

X.com06/18 06:30基础设施

Ondo 正在引领股票和 ETF 的代币化 下一步将是机器人顾问,基本上是管理股票和 ETF 投资组合的智能人工智能。

Ondo 正在引领股票和 ETF 的代币化 下一步将是机器人顾问,基本上是管理股票和 ETF 投资组合的智能人工智能。 在这一领域,Revolut 实际上领先于加密货币,现在加密货币必须赶上机器人顾问

X.com06/18 05:45基础设施

2026 年的超级计算机是 MAC MINI 的仓库。您办公桌上的 KIMI API 可在 15 分钟内提供 300 欧元的研究报告 大多数人认为运行人工智能意味着需要 10,000 美...

2026 年的超级计算机是 MAC MINI 的仓库。您办公桌上的 KIMI API 可在 15 分钟内提供 300 欧元的研究报告 大多数人认为运行人工智能意味着需要 10,000 美元的 GPU 服务器或每个月都在增长的云账单。开发人员建立真正的业务使用单一

X.com06/15 19:15基础设施

这就是本地人工智能不再是玩具时的样子 他拿着一台基于 AMD Strix Halo 构建的 128GB AI 迷你电脑。

这就是本地人工智能不再是玩具时的样子 他拿着一台基于 AMD Strix Halo 构建的 128GB AI 迷你电脑。 这就是整个转变。 多年来,大型模型的答案很简单: 租用云。 支付 API 费用。 等待GPU。 看表。 现在的模型