Rafael Raya

22 papers A* 1Misc 1Journal 11Unranked 8
YearRankTypeTitle / Venue / Authors
2023 conf
ICORR
David Pinto-Fernandez, Manuel Gómez, Camila Rodrigues-Carvalho, Ana Rojo, Rafael Raya, Eduardo Rocon, Juan C. Moreno, Diego Torricelli
2023 J jnl
Sensors
Elena Bocos-Corredor, Tomás Pérez-Fernández, Raquel Perez-Dominguez, Sonia Liébana, Susan Armijo-Olivo, Rafael Raya, Aitor Martin-Pintado-Zugasti
2023 J jnl
Virtual Real.
Ana Rojo, Rafael Raya, Juan C. Moreno
2022 J jnl
Virtual Real.
Ana Rojo, Javier Cortina, Cristina Sánchez, Eloy Urendes, Rodrigo García-Carmona, Rafael Raya
2022 conf
ICCHP-AAATE (2)
Ana Rojo, Susana Del Riego, Cristina Sánchez, Eloy Urendes, Rodrigo García-Carmona, Sergio Lerma Lara, Rafael Raya
2021 J jnl
Sensors
Cristina Sánchez, Vanina Costa, Rodrigo García-Carmona, Eloy Urendes, Javier Tejedor, Rafael Raya
2021 conf
CINAIC
Pedro Fernández Sánchez, Elizabeth Frank, Rafael Raya
2020 conf
BioRob
Vanina Costa, Oscar Ramírez, Julio S. Lora-Millán, Eloy Urendes, Eduardo Rocon, Luis Perea, Rafael Raya
2019 J jnl
Sensors
Eloy Urendes, Guillermo Asin Prieto, Ramón Ceres, Rodrigo García-Carmona, Rafael Raya, José Luis Pons Rovira
2019 J jnl
Sensors
Javier Tejedor, Constantino A. García, David G. Márquez, Rafael Raya, Abraham Otero
2018 J jnl
Sensors
Rafael Raya, Rodrigo García-Carmona, Cristina Sánchez, Eloy Urendes, Oscar Ramirez, Alvaro Martín, Abraham Otero
2017 J jnl
Interact. Comput.
Miguel A. Velasco, Alejandro Clemotte, Rafael Raya, Ramón Ceres Ruíz, Eduardo Rocon
2017 J jnl
Int. J. Hum. Comput. Stud.
Miguel A. Velasco, Alejandro Clemotte, Rafael Raya, Ramón Ceres Ruíz, Eduardo Rocon
2016 A* conf
ICRA
Cristina Bayon, Oscar Ramirez, M. Dolores del Castillo, José Ignacio Serrano, Rafael Raya, José M. Belda-Lois, Rakel Poveda, Fernando Mollà, Teresa Martin, Ignacio Martínez-Caballero, Sergio Lerma Lara, Eduardo Rocon de Lima
2016 conf
IWBBIO
Miguel A. Velasco, Rafael Raya, Luca Muzzioli, Daniela Morelli, Marco Iosa, Febo Cincotti, Eduardo Rocon de Lima
2016 conf
IWBBIO
Pablo Pérez-Tirador, Gabriel Caffarena, Constantino A. García, Abraham Otero, Rafael Raya, Rodrigo García-Carmona
2016 J jnl
IEEE Syst. J.
Miguel A. Velasco, Rafael Raya, Ramón Ceres Ruíz, Alejandro Clemotte, Antonio Ruiz Bedia, Teresa Gonzalez Franco, Eduardo Rocon de Lima
2015 ch.
Intelligent Assistive Robots
Rafael Raya, Eduardo Rocon, Eloy Urendes, Miguel A. Velasco, Alejandro Clemotte, Ramón Ceres Ruíz
2014 conf
NEUROTECHNIX
Alejandro Clemotte, Miguel A. Velasco, Diego Torricelli, Rafael Raya, Ramón Ceres
2012 J jnl
Sensors
Rafael Raya, Eduardo Rocon, Juan Alvaro Gallego, Ramón Ceres Ruíz, José Luis Pons
2012 conf
TePRA
Rafael Raya, Eduardo Rocon de Lima, Ramón Ceres Ruíz, Marta Pajaro-Blázquez
2010 Misc conf
IDC
Rafael Raya, Ramón Ceres Ruíz, Javier O. Roa, Eduardo Rocon de Lima
CLAUDE.md
← Index CLAUDE.md markdown
# CLAUDE.md

This file provides guidance to Claude Code (claude.ai/code) when working with code in this repository.

## Project Overview

REDB (RationalEdge Samples DB) is a malware analysis framework that extracts features from PE (Portable Executable) files and stores them in ClickHouse database for analysis. It provides a comprehensive set of extractors for analyzing binary samples including PE headers, imports, resources, signatures, and decompiled code.

## Common Commands

### Development Setup
```bash
source venv/bin/activate

# Install dependencies
pip install -r requirements.txt

# Run the main application
python start.py --path /path/to/samples --repo sample_repo --index_prefix redb
```

### Analysis Commands
```bash
# Process a single file
python start.py --path /path/to/binary --repo test --index_prefix redb

# Process from S3 storage
python start.py --s3 --repo malpedia --index_prefix redb

# Process from S3 storage but only a subset of a specific repository
python start.py --s3 --repo "vx-itw" --s3-notes "ITW.0138" --index_prefix redb

# Run only decompilation
python start.py --path /path/to/binary --repo test --index_prefix redb --decompile

# Run specific modules
python start.py --path /path/to/binary --repo test --index_prefix redb --modules "BasicPropertiesExtractor,PEFeaturesExtractor"

# Run as Nomad job (for containerized deployment)
python start.py --nomad-job
```

### Testing
There are no formal unit tests. Testing is done by running the extractors on sample files in the `test_files/` directory.

## Architecture Overview

### Core Components

1. **Ingestor (`redb/ingestor.py`)**: Main orchestrator that handles file processing, multiprocessing, and coordinates extractors
2. **Extractors (`redb/extractors/`)**: Modular analysis components that extract specific features
3. **Database Exporters (`redb/extractors/database_exporters.py`)**: Handle data export to ClickHouse
4. **Settings (`redb/settings/`)**: Configuration management for database connections

### Extractor Architecture

All extractors inherit from the base `Extractor` class and implement:
- `extract()`: Main analysis logic
- `prepare_export_data()`: Format data for database export
- `get_clickhouse_table()`: Return target table name

Available extractors:
- **General**: BasicPropertiesExtractor, HashExtractor, DIEExtractor, CAPAExtractor
- **PE-specific**: PEFeaturesExtractor, PEImportExtractor, PEResourceExtractor, PEOverlayExtractor, PESectionExtractor, PESignatureExtractor, PEDotNetExtractor, PEInconstistencyTestsExtractor, PEExtraFindings
- **ELF**: ELFFeaturesExtractor, ELFSegmentExtractor, ELFSectionExtractor, ELFDependencyExtractor, ELFSymbolExtractor, ELFImportExtractor, ELFExportExtractor, ELFRelocationExtractor, ELFNotesExtractor
- **Mach-O**: MachOFeaturesExtractor, MachOSegmentExtractor, MachOImportExtractor, MachOExportExtractor, MachODylibExtractor, MachOSignatureExtractor
- **APK**: APKFeaturesExtractor, APKManifestExtractor, APKPermissionsExtractor, APKSignatureExtractor, APKDexExtractor, APKResourceExtractor, APKNativeLibExtractor, APKInconsistencyTestsExtractor
- **Decompilation**: DecompileBinja, DecompileAPK

### Database Schema

The project uses a comprehensive ClickHouse schema defined in `redb/redb_schema.yml` with tables for:
- Basic properties (`redb_basic_properties`)
- PE features (`redb_pe_features`, `redb_pe_imports`, `redb_pe_sections`, etc.)
- Decompiled code (`code_binja_decompiled_functions_content`, `code_binja_decompiled_functions_references`)
- CAPA analysis (`redb_capa`, `redb_capa_capabilities`)

Full schema documentation is available in `docs/database_schema.md`.

### Processing Modes

1. **Analysis Mode**: Extracts features using selected modules
2. **Decompile Mode**: Uses Binary Ninja for code decompilation
3. **S3 Mode**: Fetches samples from S3 storage based on catalog queries
4. **Nomad Job Mode**: Processes single jobs using environment variables for containerized deployment

### Configuration

Environment variables are used for configuration:
- Database connection: `CLICKHOUSE_HOST`, `CLICKHOUSE_PORT`, `CLICKHOUSE_USER`, `CLICKHOUSE_PASSWORD`
- S3 storage: `S3_ENDPOINT`, `S3_ACCESS_KEY`, `S3_SECRET_KEY`
- Processing: `BATCH_SIZE`, `REDB_TIMEOUT`, `DECOMPILE_WORKER_TIMEOUT`
- Nomad jobs: `JOB_ID`, `S3_KEY`, `S3_BUCKET`, `WORKER_TYPE`, `CALLBACK_URL`, `ANALYSIS_MODULES`

## Important Implementation Details

### Multiprocessing
- Uses `spawn` method for multiprocessing to avoid memory issues
- Worker processes have timeout handlers to prevent hanging
- Supports both batch processing and streaming processing modes

### Memory Management
- Implements aggressive garbage collection between batches
- Monitors swap usage and restarts worker pools when needed
- Kills stuck processes automatically

### Error Handling
- Comprehensive logging with per-file context
- Graceful handling of corrupted or unsupported files
- Automatic retry logic for database operations

### Security Context
This is a defensive security tool for malware analysis. It processes potentially malicious files in a controlled environment to extract features for detection and analysis purposes.

## Development Notes

- The codebase is optimized for processing large batches of malware samples
- Extractors are designed to be modular and can be run individually or in combination
- Database schema supports both normalized and denormalized views for different query patterns
- S3 integration allows for scalable processing of large malware repositories