Two AI-powered financial analysis tools built on SEC EDGAR data.
Predicts the most likely US-GAAP XBRL tag for any financial line item.
- Training data: 1.75M label-tag pairs extracted from 68 SEC quarterly datasets (44M raw rows)
- Model: QLoRA fine-tuned Qwen3-4B (r=16, alpha=32, 3 epochs on A100-40GB)
- Baseline: Bigram similarity matching against 1,000-tag vocabulary (86.4% coverage)
- Input: Financial line item text + statement type (IS/BS/CF/EQ/CI) + optional SIC code
Flags companies whose financial ratios deviate significantly from industry peers.
- Data: 74,993 company-period records across 7,553 companies, 71 industries (2022-2024)
- Ratios: 10 financial ratios (margins, ROA/ROE, leverage, liquidity, R&D intensity, AR turnover)
- Method: IQR-based scoring by 2-digit SIC code (robust against fat-tailed financial data)
- Source: SEC EDGAR Financial Statement Data Sets (num.txt + sub.txt)
pnpm install
pnpm devOpen http://localhost:3000 (or the port shown in terminal).
The scripts/ directory contains the Python data pipeline:
68 SEC quarterly zips -> extract_fintag_data.py -> 1.75M SFT training pairs
-> build_finanomaly_db.py -> DuckDB (74K company-period ratios)
-> modal_fintag_train.py -> QLoRA adapter (Modal A100-40GB)
To rebuild from scratch:
./scripts/run_all.sh # extract + build DB
./scripts/run_all.sh --train # also run Modal training- Next.js 16 App Router with Tailwind CSS
- API routes read pre-exported JSON data server-side (no database dependency)
- FinTag baseline uses bigram Dice coefficient for fuzzy matching
- FinAnomaly uses IQR-based z-scores (more robust than standard deviation for financial data)
Python (data pipeline) + TypeScript/Next.js (demo UI) + Modal (GPU training)