NSCT Agent a8595cc950 Stage 3: Crawler und Content Extraction
- AsyncFetcher: Sicheres HTTP-Fetching mit SSRF-Schutz, Connection Pooling
  (50/10), Timeout, Redirect Limit, Rate Limiting, User-Agent
- Content-Extraction: trafilatura für HTML→Text, BeautifulSoup4 Fallback
- PDF-Extraction: pdfminer.six mit Error-Handling
- NormalizedDocument: Schema (url, title, text, metadata, links,
  content_hash, extraction_tool, extracted_at, word_count)
- Crawler-Manager: SSRF-Check → robots.txt → HTTP-Fetch → Extraction →
  Normalization (Batch-fähig, Error-Isolation pro Fetch)
- Security-Policy: SSRF-Schutz (RFC1918, Cloud Metadata, file://, ftp://,
  localhost), URL-Validation (nur http/https)
- Crawler-Endpoints: POST /crawler/fetch, /crawler/fetch/batch,
  /crawler/validate-url
- Test-Cases: SSRF-Schutz, Content Extraction, NormalizedDocument,
  Error Handling, Content Hash Determinismus
2026-08-23 12:53:19 +00:00

============================================================

NSCT — Neutral Search Crawler Tool

============================================================

NSCT ist ein vollständig lokal betreibbares, containerisiertes Recherche- und Analyse-System. Es durchsucht Webquellen, extrahiert Inhalte, vergleicht Behauptungen (Claims) aus verschiedenen Quellen und erzeugt einen neutralen, quellengestützten Bericht.

NSCT steht für: Neutral Search Crawler Tool.

Architektur-Übersicht

┌─────────────┐    ┌──────────────┐    ┌───────────────┐
│  User / CLI  │───▶│  NSCT API    │───▶│  FastAPI /    │
│              │    │  (FastAPI)   │    │  uvicorn      │
└─────────────┘    └──────────────┘    └───────────────┘
                           │
              ┌────────────┼─────────────┐
              ▼            ▼             ▼
        ┌───────────┐ ┌─────────┐  ┌──────────┐
        │ LLM       │ │ Vision  │  │  Audio   │
        │ Provider  │ │ Model   │  │  Model   │
        └───────────┘ └─────────┘  └──────────┘
              │            │             │
              ▼            ▼             ▼
        ┌─────────────────────────────────────┐
        │   PostgreSQL (evidence store)        │
        └─────────────────────────────────────┘
              ▲
              │
        ┌──────────────┐
        │  SearXNG      │ (optional search backend)
        └──────────────┘

Quick Start

Docker Compose

# 1. Kopiere die Beispiel-Env
cp .env.example .env
# 2. Trage deine Endpunkte ein (LLM, Vision, Audio, PostgreSQL)

# 3. Starte alles
docker compose up --build

# 4. Prüfe den Health-Check
curl http://localhost:8080/health

Die API ist danach unter http://localhost:8080 erreichbar. /docs zeigt die auto-generierte Swagger-Dokumentation (nur bei NSCT_DEBUG=true).

Projektstruktur

nsct/
├── src/nsct/
│   ├── api/          # FastAPI-Routen
│   ├── models/       # Pydantic-Schemata
│   ├── providers/    # Abstrakte Provider-Interfaces
│   ├── security/     # SSRF-Schutz, URL-Validierung
│   └── storage/      # SQLAlchemy Models + Engine
├── tests/            # pytest-Tests
├── docker-compose.yml
├── Dockerfile
├── pyproject.toml
├── README.md
├── ARCHITECTURE.md
├── SECURITY.md
├── METHODOLOGY.md
├── API.md
├── DEPLOYMENT.md
└── .env.example

Status

Stage 0 — Repository und Architekturgrundlage.

Stage 0 enthält:

  • Vollständige Projektstruktur mit allen Konfigurationsdateien
  • Pydantic v2 Datenmodelle
  • SQLAlchemy 2.0 Persistenzmodelle
  • Sicherheitshards (SSRF-Schutz, IP-Blocklist)
  • Provider-Interfaces (abstrakte Basisklassen)
  • Health-, Ready- und Provider-Endpunkte
  • Strukturiertes Logging
  • Docker-Konfiguration für PostgreSQL, SearXNG und NSCT

Die eigentliche Evidence-Pipeline (Search, Fetch, Extract, Claim, Compare, Report) wird in späteren Stages implementiert.

Lizenz

MIT

Description
No description provided
Readme 1.5 MiB
Languages
Python 99.9%
Dockerfile 0.1%