Jack He / Lemon

PROJECTS

项目与实践

围绕 AI 评测、模型可靠性与开发者工具的公开项目。

01 / Agent evaluation

X7AgentEval

多轮对话测评

用途

评估智能客服在多轮交互中的回答和调用过程。

提供什么

  • 模拟用户驱动多轮对话
  • 结合对话内容与节点日志评分
  • 生成 Markdown 报告,支持断点续传

02 / Evaluation evidence

zoda-kina-explorer

模型选型与证据浏览

用途

查看模型选型指标,并追溯 KINA 运行与样本记录。

提供什么

  • 成本、准确率与观测延迟对比
  • 模型视图与评测证据视图分离
  • 浏览运行记录与样本数据

延迟视图表示当次运行的观测值;并发、重试和端点条件会影响结果。

03 / Developer tools

bocha-search-mcp

MCP 搜索工具

用途

为 Claude Code 等 Agent 接入博查搜索。

提供什么

  • 网页搜索与 AI 语义搜索
  • 候选内容的语义重排
  • 结构化结果与错误诊断

04 / Model reliability

LLMprobe-engine

Fork · 上游 Bazaarlinkorg/LLMprobe-engine

用途

通过探针检查模型 API 的行为与输出。

提供什么

  • 质量、安全性与完整性探针
  • 模型身份相关检查
  • CLI 与 Node.js 库接口

Fork 项目,上游来源:Bazaarlinkorg/LLMprobe-engine ↗。

项目说明依据公开仓库 README 整理。具体功能、配置和使用方法请以仓库为准。