新智元报道
从未见过如此糟糕的模型!
Gemini 3.5 Pro正式版没来,3.6 Flash、3.6 Flash Lite等Gemini 3.6「阉割版」发布了!
就在昨夜,谷歌DeepMind宣布,推出三款模型,分别为Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。
在Vertex AI上线后,谷歌最新发布的Gemini 3.6 Flash口碑遭遇滑铁卢。
早期实测显示,该模型在前端界面生成与空间推理方面表现极差,被用户戏称为「史上最差」。
好消息,Gemini 3.6 Flash比GeminI 3.1 Pro、Gemini 3.1 Pro强,主打「性价比」。
然而网友们关心的是:我那么大一个Gemini 3.5 Pro呢?
谷歌「史上最差」AI模型发布!
谷歌新模型,上线就被骂「史上最差」了。
从前端到空间推理,得到的全是差评。
先看前端生成。
Gemini-3.6 Flash前端能力全线崩盘,在前端代码竞技场中不敌Claude Fable 5、GPT-5.6 Sol等当红模型,甚至不如Meta的Muse Spark 1.1。
开发者用2-shot测试Gemini 3.6 Flash的界面生成能力,这本是Flash系列最擅长的场景之一。
结果出来,直接懵了。
输出的界面代码逻辑错乱,组件嵌套混乱,交互逻辑断裂,完全无法投入实际使用。
「这是我真正见过的最差结果。」
这句话配上截图,在开发者社区迅速传播。
再看空间推理。
他还专门录制了视频,逐帧测试Gemini 3.6 Flash在空间关系理解上的表现。
测试结果同样让人失望:模型频繁出错,对基础的位置关系、方向判断的准确率,相比3.5 Flash明显退步。
他也只能自我安慰可能自己没有开启高性能模型「high thinking」。
遗憾的是,即便开启,也没有最好的结果可以报告,另一个网友使用了高推理强度,第一印象不佳。
木纹纹理看起来还行,没什么特别之处。
大理石近距离看反射效果还不错,但存在 bug。
第二印象甚至更差:
CursorBench上,Gemini 3.6 Flash还不如Cursor的Composer 2.5。
谷歌发布的测试结果,也显示Gemini 3.6 Flash在代码任务上被其他模型超越,仅在视觉和上下文基准测试中持续保持领先水平。
但在第三方综合测评Artificial Analysis上,Gemini 3.6 Flash得分与3.5 Flash完全相同,表现不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra……
有网友发现它的知识截止日期实际上并未更新到它所声称的时间,直言:
这是一个未完成的模型。
它声称是2026年3月,但实际上它对 2026 年甚至 2025 年的大部分内容一无所知。它的实际知识似乎停留在 2025 年1月。
Gemini 3.5 Flash-Lite则主打速度快,每秒可输出350个token。
速度确实快了。但快有什么用?快速给出一个错误答案,等于用更高的效率浪费用户的时间。
更何况,和竞争对比手,价格更贵,效果更差!
此外 ,谷歌这次还发布了网络安全模型Gemini 3.5 Flash Cyber。
谷歌:Gemini 3.5 Pro延期、4已预训练
在算力紧缺的时代,发布一个逻辑混乱的模型,是否也是渎职?
有用户讽刺称,DeepMind 这种浪费算力的行为,还不如直接将资源转让给Moonshot等竞争对手。
这番言论背后,是开发者对谷歌「版本号游戏」的深层厌恶。
谷歌似乎陷入了某种「官僚主义的指标狂热」:为了在财报和发布会上展示更高的版本号、更快的推理速度,他们牺牲了AI最本质的东西——真实效用。
3.6 Flash的发布公告中,谷歌提到,Gemini 3.5 Pro还没有完全准备好,而Gemini 4已开始「目前最雄心勃勃的预训练」,并「对取得的进展感到非常振奋」。
推测来看,近期3.5 Pro的开发进展并不理想,因此他们启动了全新的预训练课程。
据CNBC报道,这是谷歌「有史以来规模最大的预训练项目」。
这次谷歌步子迈大了。
谷歌这种赶鸭子上架,败坏口碑的做法到底图什么?
谷歌还能在AGI竞赛中有一席之地吗?
参考资料:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
https://x.com/Waguri_Kaoruko8/status/2079432904283754652
编辑:大卫