Popular repositories Loading
-
agent-workbench
agent-workbench PublicInteractive Development Environment for Claude Code
-
-
qmsum-demo
qmsum-demo PublicLobu + promptfoo + QMSum end-to-end demo: ingest meeting transcripts, ground an agent, run RAG evals.
Python
-
agent-memory-benchmark
agent-memory-benchmark PublicClickBench-style, fair, reproducible benchmark for agent long-term memory systems
TypeScript 1
-
STATE-Bench
STATE-Bench PublicForked from microsoft/STATE-Bench
Benchmark AI Agents on Enterprise Workflows
Python
Repositories
-
- wandr Public
WANDR: a benchmark for wide and deep research (Apache-2.0, originally by Perplexity AI). Includes a Lobu Relay endpoint.
- agent-memory-benchmark Public
ClickBench-style, fair, reproducible benchmark for agent long-term memory systems
- qmsum-demo Public
Lobu + promptfoo + QMSum end-to-end demo: ingest meeting transcripts, ground an agent, run RAG evals.
Top languages
Loading…
Most used topics
Loading…