HELM
斯坦福大模型标准化评测平台
HELM是由斯坦福大学推出的大模型评测体系,该评测方法主要包括场景、适配、指标三个模块,每次评测的运行都需要指定一个场景,一个适配模型的提示,以及一个或多个指标。
斯坦福大模型标准化评测平台
HELM是由斯坦福大学推出的大模型评测体系,该评测方法主要包括场景、适配、指标三个模块,每次评测的运行都需要指定一个场景,一个适配模型的提示,以及一个或多个指标。
AI智能评测与推荐平台
AI Ping是专注于AI大模型服务性能评测的平台,提供实时、客观的API性能数据,包括首token延时、整体延迟、吞吐量等关键指标。平台覆盖国内外主流模型服务商与模型,支持排行榜对比、数据可视化与历史追踪,帮助开发者、企业团队及研究人员进行模型选型、性能监控与成本优化决策。
AGI模型能力公正评测平台
AGI-Eval是由上海交大、同济大学、华东师大及DataWhale联合推出的大模型评测社区。平台提供权威模型能力榜单、丰富的评测数据集、人机协同比赛及Data Studio数据工坊,旨在通过科学、透明的评估体系,衡量AI模型在理解、推理、知识等维度的综合表现,为研究者和开发者提供评测支持。
大模型性能权威评测榜单
OpenCompass LLM排行榜是一个开源的大语言模型评估平台,提供超过100个数据集的基准测试,涵盖知识、逻辑、数学、代码等维度。榜单实时更新,展示GPT-4、Claude、Qwen等开源与商业模型的综合性能排名,为研究者和开发者提供客观的模型选择参考。
本地偏好 · 配色仅保存在当前浏览器
点此注册,收藏与评论更方便
Welcome! This site is in Chinese. Tap EN in the top bar to read in English.