在技术性能与基准测试上,Astra相较于前代及同类模型实现了颠覆性提升。在ARC-AGI-3测试中,Astra取得98.6%的极高得分,远超GPT-5.6Sol(7.8%)及Claude Opus5(30.2%);在FrontierMath Tier4(v2)中得分为97.6%,显著领先同类大模型;并在GPQA Diamond(96%)、DeepSWE v1.1(74.1%)、Terminal-Bench Science0.1(64.6%)、Agents' Last Exam(59.3%)及AutomationBench(41.4%)等多项测试中全面领跑。