
新智元报道

Gemini 4 Pro,又曝出新的检查点了!
最近,两个全新检查点(内部代号“barium-b”或 Checkpoint 2)被开发者们发现了,实测后发现,Gemini 4 Pro强得可怕!


有开发者直呼:“在爆肝 400 小时使用 Opus 5.5 和 GPT-6 之后,Gemini 4 Pro 依然让我头皮发麻!”

谷歌的新一代大杀器,展现出超强的3D 物理模拟能力、代码生成能力和长文本推理能力。
有开发者直呼:“在爆肝 400 小时使用 Opus 5.5 和 GPT-6 之后,Gemini 4 Pro 依然让我头皮发麻!”
而且,谷歌内部高层的态度也很鲜明。
Google DeepMind新任掌门Koray Kavukcuoglu首次公开确认:Gemini 4已经进入后训练早期。
它的训练进度大大提前,仅耗时两个月,早期预训练就基本结束。

准备好,一大波硬核实测来了!

核心实测大赏:7大硬核Demo
一夜之间,仿佛每个人都能用Gemini 4 Pro了。
从晒出的Demo来看,它在3D生成、物理引擎模拟和长文本代码构建上的表现,令人惊艳。

孔雀SVG测试也来了,显示出巨大的飞跃。


水上飞机起飞,吊打Opus 5.5
知名测评博主 @AI_Screening 要求它和Opus 5.5用代码生成一个3D浮筒飞机在水面滑行起飞的物理模拟。
之前,Opus 5.5生成的视频惊呆了一大群人,但没想到,这次,Gemini 4 Pro的表现完全超越了它!

可以看到,Opus 5.5生成的飞机虽然在动,但机身晃动剧烈,仿佛随时要解体,水面的物理反馈也很生硬。
但Gemini 4 Pro就要丝滑多了,加速平稳,水面反射清晰,对“溅水”效果的渲染很逼真。
从流体力学逻辑和画面整洁度看,属于把Opus 5.5按在地上摩擦。

16分钟手搓“3D国际空间站”
开发者 @thtbee_ 抛出了一个王炸。
在没有任何3D模型导入的情况下,Gemini 4 Pro 仅仅用了 16分钟,通过纯代码,就生成了一个交互式的3D国际空间站绕地球运行的模拟程序!


令人惊喜的是,它不仅自己用 Three.js 建好空间站模型,还很聪明地从网上抓取了正确的地球贴图,保证经纬度和颜色绝对准确。

这种“无中生有”的建模能力,让人惊叹。
当然,也有人吐槽生成的UI界面有点丑,且背面仍有透视bug。
从灯塔到火箭发射(Three.js渲染)
网友 @HarshithLucky3 甩给它一个高难度指令:“用 Three.js 将一个灯塔变成火箭发射,不要包含任何UI元素。”

结果,Gemini 4 Pro 完美遵循了指令!
测试者夸爆了它的“审美”:它为画面中的所有元素都添加了质感极佳的纹理,整个3D输出质量好到离谱。

3D Wii 遥控器高精度还原
开发者 @LuminaBench 测试了它的工业设计建模能力,让它生成一个 3D 的任天堂 Wii 遥控器。

结果,它对3D物体的细节把握非常强,并且生成速度“快得难以置信”!
要说有什么不完美,就是它在处理Prompt时似乎有点过度雕琢,会竭尽全力去丰富细节,哪怕你没要求。
不过,它的设计审美在不同部件上表现不太稳定,有些地方绝佳,有些地方略显违和。

据测试,Checkpoint 2 的细节密度非常出色,而且精确度高得多,还是目前最快的前沿模型,无人能及。



机械蜂鸟,碾压 GPT-6 Sol
博主 @TimJayas 甩出了他的“祖传”机器蜂鸟prompt,考验模型对复杂机械结构和动态行为的理解。

结论是:“Gemini 4 Pro 的表现简直太棒了!老实说,质量与 Fable 旗鼓相当,但远远好于 GPT-6 Sol!”


当然,它有时也会被GPT-6 Astra碾压。



14分钟生成完整网站,单提示词生成游戏
而且,它的工程能力超强。
一位开发者仅用 14分钟,就生成了一个极具创意的产品展示完整网站,前后端全包。“真的就是几分钟一个网站。”
更让人惊喜的是,多人反馈,只需要输入一个Prompt,它就能直接给你吐出一个完整交互的网页游戏。



参数大泄露:1000万上下文+自主智能体
虽然新检查点最近才曝光,但Gemini 4 Pro的参数此前就已经泄露了。
有人曝出,Gemini 4 Pro有1000万Token的上下文窗口,和256k的输出上限,如果属实,就彻底告别“代码写一半就断”的噩梦,一句话生成大型软件的全套代码。
它可以永久跨会话记忆,无需API即可联网,具备真正的AI Agent能力。

甚至,它还有机器人控制能力, 可以直接作为大脑,控制现实物理世界中的机器人!
此前一张基准测试图显示,Gemini 4 Pro在编程、智能体、推理上均超越 GPT-6 Astra 和 Claude Fable 5.1。
它在AI智能体编程测试(DeepSWE v1.1)拿下 88%,在编码能力测试(Terminal-bench 2.1)飙到惊人的 95.3%!
有人惊呼:闻到了RSI的味道。



谷歌真急了:2个月训完,全军冲刺4.0!
为什么Gemini 4 Pro会突然空降?因为谷歌的底线被碰了。
落后GPT-6和Opus 5.5一段时间后,巨头开始反扑。
就在周三,Google DeepMind 新任掌门人 Koray Kavukcuoglu 首度公开“交底”,透露了重磅消息。
根据The Information爆料,Koray 透露,Gemini 4 自 7 月启动了“有史以来最具野心的预训练”后,仅仅耗时约两个月,就基本完成了早期预训练!
目前,Gemini 4 已经全面进入了重要的“后训练”阶段。
“我们的意图是尽可能快地发布一个早期的后训练版本,”Koray 难掩兴奋地表示,“因为我们看到了结果,我们感到非常激动!”
这也是为什么,竞技场上会突然冒出这个“半成品但已经极强”的测试节点。

而且,发现Gemini 3.5 Pro 性能不足以碾压对手后,谷歌直接壮士断腕,把所有算力全砸向 Gemini 4!
当被尖锐地问及“是否担心谷歌已经落后于同行”时,Koray斩钉截铁地说:“我对我的团队有百分之百的信心,我们注定永远要站在技术的最前沿。”
他透露,Gemini 4 目前正在被内部工程师用于Antigravity AI ——这是对之前“谷歌员工用 Claude 写代码”传闻的回击。
而且,他强调,他们不再执着于AGI的概念,“真正的问题是,我们是否有能力构建出我们可以完全信任的智能体”?
他还透露,Gemini 4 的研发,帮助谷歌硬件工程师设计“未来两到三代的 TPU”。显然,这种算法与芯片底层深度绑定的护城河,让英伟达很警惕。
最后,Koray 抛出了时间表:他希望 Gemini 4 的正式发布时间能“远早于年底”。

还有消息称,Gemini 4 Pro十一就可能发布
性能炸裂就算了,谷歌还准备掀起价格战。据泄露,Gemini 4 Pro 的定价极具攻击性:
输入:$2.25 / 100 万 Tokens
输出:$11.25 / 100 万 Tokens

对比友商动辄几十美刀的旗舰模型,这简直是“骨折价”。
难怪有人喊话:“这性价比绝了,4 Pro要是真超预期,现在充会员就是抄底!”
而且,谷歌要把 AI 芯片送上天了!
下周,谷歌将搭乘 SpaceX 的猎鹰9号,把装有4颗 TPU 芯片的卫星送入太空!
未来,天上可能真会出现一张庞大的星链 AI 数据中心网。
看来,此前LMSYS里的 gemini-3.8-flash 只是“极早期后训练”的冰山一角。
但正如测试者所言:“第二个检查点比第一个检查点有了肉眼可见的巨大飞跃,谷歌这次是真的在‘烹饪’一道大菜。”
OpenAI和Anthropic如何接招?
Gemini 4 Pro的加入,会不会改变ASI决赛的终局?
精彩评论