趣猫🐱
1 天前
🍭
#大模型评估 #游戏逻辑测试
🏵
llm-bulls-and-cows-benchmark
- LLM猜数字游戏逻辑评估框架
🍥
简介:
该轻量级框架旨在评估大语言模型在“猜数字”(Bulls and Cows)逻辑游戏中的性能表现。程序内置多种模型API接口,通过标准化测试流程量化模型的推理能力、逻辑遵循度及数字序列处理效率,为开发者提供客观的性能基准参考数据。
🎈
【进入项目】
🗣
活动线报
|
掘金项目
Home
Powered by
BroadcastChannel
&
Sepia