OpenCompass司南 需要客观评估大模型性能?OpenCompass司南是开源的大模型评估平台,提供全面、可复现的评测与排名,支持大语言模型、多模态模型等七大类评测,覆盖模型研发、技术尽调、学术研究等场景,可在其官方网站或通过开源工具链使用,评测结果权威中立,适合AI研究员、开发者及企业决策者。 020 模型评测# 开源项目# 通用大模型
HELM 需要科学评估大模型性能与风险?HELM是斯坦福大学推出的开源基准测试框架,专注系统性评估语言模型的准确性、公平性、鲁棒性与效率,支持医疗、金融等垂直领域测评,可在其官方网站获取代码与文档,适合AI研究员与企业技术负责人进行模型选型与合规审计。 020 模型评测# 开源项目# 通用大模型
Salesforce Einstein Salesforce 客户管理平台内置的 AI 能力,提供线索评分、销售预测与内容推荐;原对话助手已更名并改独立计费,适合日常使用。 020 模型厂商# 对话助手