OpenCompass司南 - 评测榜单
大模型性能权威评测榜单
OpenCompass LLM排行榜是一个开源的大语言模型评估平台,提供超过100个数据集的基准测试,涵盖知识、逻辑、数学、代码等维度。榜单实时更新,展示GPT-4、Claude、Qwen等开源与商业模型的综合性能排名,为研究者和开发者提供客观的模型选择参考。
「大模型评测」是 芝麻派AI 下的 AI 资源专题分类,收录 11 款相关工具。你可以在本页按热度与更新时间浏览,并进入详情页查看功能说明、适用场景与同类对比。 热门包括:MMLU、HELM、AGI-Eval评测社区。
选型建议:挑选「大模型评测」工具时,先明确使用场景(个人 / 团队 / 企业),再对比免费额度、中文支持与国内访问;芝麻派AI 各资源详情页提供「同类备选」便于横向对比。
「大模型评测」是 芝麻派AI 下的 AI 资源专题分类,收录 11 款相关工具。你可以在本页按热度与更新时间浏览,并进入详情页查看功能说明、适用场景与同类对比。 热门包括:MMLU、HELM、AGI-Eval评测社区。
本站热门推荐:MMLU(多任务语言理解基准评测);HELM(斯坦福大模型标准化评测平台);AGI-Eval评测社区(AGI模型能力公正评测平台);C-Eval 排行榜(评估中文AI模型能力排行榜);OpenCompass司南 – 评测榜单(大模型性能权威评测榜单)。
挑选「大模型评测」工具时,先明确使用场景(个人 / 团队 / 企业),再对比免费额度、中文支持与国内访问;芝麻派AI 各资源详情页提供「同类备选」便于横向对比。
大模型性能权威评测榜单
OpenCompass LLM排行榜是一个开源的大语言模型评估平台,提供超过100个数据集的基准测试,涵盖知识、逻辑、数学、代码等维度。榜单实时更新,展示GPT-4、Claude、Qwen等开源与商业模型的综合性能排名,为研究者和开发者提供客观的模型选择参考。
本地偏好 · 配色仅保存在当前浏览器
点此注册,收藏与评论更方便
Welcome! This site is in Chinese. Tap EN in the top bar to read in English.