MMBench MMBench 是由 OpenCompass 提供的多模态大模型评测基准与排行榜平台,面向图像理解、视觉问答、推理等多模态任务,展示不同模型在统一评测集上的性能表现。网站提供模型排名、评测结果和相关指标信息,便于研究人员、开发者和用户了解多模态模型能力差异,跟踪模型评测进展,并为模型选型、学术研究和应用参考提供客观数据支持。 效率助手 # AI基准测试 # OpenCompass
OpenCompass OpenCompass 是面向大语言模型与多模态模型的评测榜单平台,提供模型得分、排名及多能力维度评估结果。网站通过客观、中立的评测数据,帮助研究人员、开发者和企业用户了解不同大模型在语言理解、推理、多模态等能力方面的表现,为模型选型、能力对比和技术研究提供参考。 效率助手 # AI基准测试 # 多模态模型
C-Eval C-Eval 是一个面向中文大模型能力评测的综合性基准平台,覆盖人文、社科、理工、医学、法律等多个学科领域。网站提供中文评测榜单与相关数据展示,便于用户了解不同模型在多任务中文考试场景下的表现。C-Eval 适合研究人员、开发者和模型使用者参考,用于比较中文语言模型的知识理解、推理与专业能力表现。 效率助手 # AI评测 # C-Eval
FlagEval FlagEval 是由北京智源人工智能研究院推出的大模型评测平台,面向人工智能模型能力评估与对比分析。网站提供模型榜单、评测任务、趋势数据等信息,覆盖语言理解、推理、代码、知识问答等多个维度,帮助用户了解不同大模型在公开基准和综合能力测试中的表现。平台适合研究人员、开发者及 AI 从业者用于模型选型参考、评测结果查询和行业趋势观察。 效率助手 # AI榜单 # 基准测试
MMLU MMLU(Massive Multitask Language Understanding)是用于评估大语言模型多任务语言理解能力的基准任务,涵盖人文、社会科学、自然科学、工程、数学等多个学科领域。Papers with Code 的 MMLU 页面汇总了该任务的最新论文、模型性能排行、评测指标和相关代码资源,便于研究人员了解模型在知识理解、推理和跨领域任务 对话与写作 # AI评测 # MMLU
Scale AI Scale AI 是一家面向 AI 实验室、政府机构和大型企业的数据与评估服务平台,提供用于人工智能模型训练、测试与部署的数据标注、数据管理、模型评估和结果交付等能力。其服务覆盖自动驾驶、生成式 AI、企业智能化与公共部门等场景,帮助客户获取高质量数据、评估模型表现并优化 AI 应用效果。 效率助手 # AI数据平台 # 企业AI
StableVicuna StableVicuna 是可通过 LMSYS Chatbot Arena 平台访问的开源对话式 AI 模型之一,面向自然语言问答、内容生成、对话交流等场景。用户可在网页中体验不同大语言模型的聊天能力,并进行模型对比与交互测试。该站点适合关注开源大模型、AI 聊天机器人、语言模型评测与在线体验的用户参考使用。 对话与写作 # AI聊天 # Chatbot Arena
Lamini Lamini 是一个专注于企业级大模型开发与部署的 AI 平台,提供大语言模型微调、定制、评估和推理等能力,帮助团队基于自身数据构建专属 AI 应用。平台面向需要安全、可控和可扩展 AI 解决方案的企业与开发者,适用于知识问答、自动化流程、数据分析和行业模型构建等场景。 后端架构 # AI部署 # 企业级AI
阿里巴巴M6 阿里巴巴M6是阿里云推出的生成式大模型应用入口,面向开发者、企业和个人用户提供智能对话、内容生成、代码辅助、知识问答等能力。平台依托阿里云大模型与云计算基础设施,支持多场景 AI 应用体验与能力接入,适合用于了解阿里系人工智能产品、探索大模型服务及相关解决方案。 对话与写作 # 代码辅助 # 内容生成
序列猴子 序列猴子开放平台是出门问问推出的超大规模语言模型服务平台,面向开发者和企业提供长序列、多模态、单模型与大数据能力支持。平台依托通用表示能力和推理能力,可用于多轮对话、内容生成、信息理解、智能交互等应用场景,帮助用户构建更便捷、流畅的 AI 应用体验。 后端架构 # AI开放平台 # API服务