DeepSeek V4 Flash 0731 achieves 61.4% on ARC-AGI-2 at $0.04 per task
DeepSeek V4 Flash 0731 scored 61.4% accuracy on the ARC-AGI-2 abstract reasoning benchmark at a cost of $0.04 per task, and 89.0% on ARC-AGI-1 at $0.02 per task, reportedly undercutting closed-source models like OpenAI and Anthropic by over 10x in cost.
Detected & updated continuously · Source: Nebula
Story subjects
Sources
@PANewsCN
DeepSeek V4 Flash 0731:推理能力追上大厂,成本却只要 4 美分 DeepSeek V4 Flash 0731 在在抽象推理测试中达到 61.4% 准确率(ARC-AGI-2),每次任务成本 4 美分,比 OpenAI、Anthropic 等闭源模型便宜 10 倍以上。 https://t.co/LwcASyi9rB
@NFT_Chen
🔥 最新数据:DeepSeek V4 Flash 强到爆表! 官方 ARC-AGI 验证出炉: ✅ ARC-AGI-1:89.0% | 仅 $0.02/task ✅ ARC-AGI-2:61.4% | 仅 $0.04/task 直接刷新成本-性能帕累托前沿! 测试环境简要补充: 🔹推理服务由 @baseten 提供 🔹基于 Semi-Private 半私有集验证(Max 推理档) https://t.co/9zj7kFEtgu