用途
评估智能客服在多轮交互中的回答和调用过程。
提供什么
- 模拟用户驱动多轮对话
- 结合对话内容与节点日志评分
- 生成 Markdown 报告,支持断点续传
PROJECTS
围绕 AI 评测、模型可靠性与开发者工具的公开项目。
评估智能客服在多轮交互中的回答和调用过程。
查看模型选型指标,并追溯 KINA 运行与样本记录。
延迟视图表示当次运行的观测值;并发、重试和端点条件会影响结果。
为 Claude Code 等 Agent 接入博查搜索。
通过探针检查模型 API 的行为与输出。
Fork 项目,上游来源:Bazaarlinkorg/LLMprobe-engine ↗。
项目说明依据公开仓库 README 整理。具体功能、配置和使用方法请以仓库为准。