项目核验档案
chinese-llm-benchmark 是一个面向中文大语言模型的多维度评测榜单与缺陷数据库,覆盖约393个模型及200万条缺陷案例,为社区提供模型能力评估与改进参考。
该项目公开了包含超过200万条记录的中文模型缺陷库,可作为社区研究模型短板与改进方向的实证数据来源。
内容核验时间:
把需求说清楚,让项目选择更有依据
告诉我们你要解决什么、运行在哪里、哪些条件不能妥协。雷达会从已核验项目中给出主推荐、备选和采用前检查。