AI 产品
评测对比:Kimi K3在深度研究任务中显著优于GLM 5.2
一项使用Perplexity的DRACO基准测试对两个大型语言模型进行的评测显示,Kimi K3在100项深度研究任务中的平均得分(71.6分)和通过率(77%)均大幅领先于GLM 5.2(平均41.5分,通过率22%)。在执行效率方面,GLM 5.2用时(1小时45分钟)更短且成本(12.50美元)更低,而Kimi K3耗时3小时38分钟,费用为60美元。评测由Fable进行评判。此信息来源于社交媒体讨论,尚属独立测评。
多来源证据
事件时间线
- Twitter/X AI List我们用DRACO基准测试了GLM 5.2和Kimi K3,并请Fable担任评委