Haibo Ge

13 papers Journal 11Unranked 2
YearRankTypeTitle / Venue / Authors
2024 J jnl
IEEE Internet Things J.
Yuan Zhang, Rui Wang, Erwu Liu, Bofeng Li, Haibo Ge
2024 J jnl
IEEE Trans. Geosci. Remote. Sens.
Zhilu Wu, Bofeng Li, Haibo Ge, Leitong Yuan, Yanxiong Liu
2024 J jnl
Geo spatial Inf. Sci.
Yanning Zheng, Haibo Ge, Bofeng Li
2024 J jnl
IEEE J. Sel. Top. Appl. Earth Obs. Remote. Sens.
Haibo Ge, Guanlong Meng, Bofeng Li
2023 J jnl
Remote. Sens.
Ruihui Li, Zijian Zhang, Yu Gao, Junyi Zhang, Haibo Ge
2023 J jnl
IEEE Access
Haibo Ge, Shuxian Wang, Chaofeng Huang, Yu An
2022 J jnl
Geo spatial Inf. Sci.
Haibo Ge, Bofeng Li, Song Jia, Liangwei Nie, Tianhao Wu, Zhe Yang, Jingzhe Shang, Yanning Zheng, Maorong Ge
2021 J jnl
Remote. Sens.
Min Li, Tianhe Xu, Haibo Ge, Meiqian Guan, Honglei Yang, Zhenlong Fang, Fan Gao
2020 J jnl
Remote. Sens.
Haibo Ge, Bofeng Li, Maorong Ge, Liangwei Nie, Harald Schuh
2020 J jnl
Remote. Sens.
Byung-Kyu Choi, Kyoungmin Roh, Haibo Ge, Maorong Ge, Jung-Min Joo, Moon Beom Heo
2019 conf
SSCI
Qiuyue Wei, Li'ang Liu, Fansi Wei, Haibo Ge, Anqi Feng, Yan Wang, Wenhao Li
2019 conf
ICCT
Wenzhu You, Haibo Ge
2018 J jnl
Remote. Sens.
Haibo Ge, Bofeng Li, Maorong Ge, Nan Zang, Liangwei Nie, Yunzhong Shen, Harald Schuh
redb/extractor_registry.py
← Index redb/extractor_registry.py python
"""
Extractor registry with lazy loading by file type.

Groups extractors by file type (pe, elf, macho, apk) and only imports
the relevant group when that file type is first encountered. This avoids
loading heavy dependencies (pefile, lief, androguard, etc.) into workers
that don't need them.
"""
import importlib
import logging

logger = logging.getLogger(__name__)

# Registry: group name -> list of (module_path, class_names)
_REGISTRY = {
    "pe": [
        ("redb.extractors.pe_extractors", [
            "PEFeaturesExtractor",
            "PEImportExtractor",
            "PEResourceExtractor",
            "PEOverlayExtractor",
            "PESectionExtractor",
            "PESignatureExtractor",
            "PEExtraFindings",
            "PEInconstistencyTestsExtractor",
            "PEDotNetExtractor",
        ]),
    ],
    "elf": [
        ("redb.extractors.elf_extractors", [
            "ELFFeaturesExtractor",
            "ELFSegmentExtractor",
            "ELFSectionExtractor",
            "ELFDependencyExtractor",
            "ELFSymbolExtractor",
            "ELFImportExtractor",
            "ELFExportExtractor",
            "ELFRelocationExtractor",
            "ELFNotesExtractor",
        ]),
    ],
    "macho": [
        ("redb.extractors.macho_extractors", [
            "MachOFeaturesExtractor",
            "MachOSegmentExtractor",
            "MachOImportExtractor",
            "MachOExportExtractor",
            "MachODylibExtractor",
            "MachOSignatureExtractor",
        ]),
    ],
    "apk": [
        ("redb.extractors.apk_extractors", [
            "APKFeaturesExtractor",
            "APKManifestExtractor",
            "APKPermissionsExtractor",
            "APKSignatureExtractor",
            "APKDexExtractor",
            "APKResourceExtractor",
            "APKNativeLibExtractor",
            "APKInconsistencyTestsExtractor",
        ]),
        ("redb.extractors.decompiler.DecompileAPK", [
            "DecompileAPK",
        ]),
    ],
    "js": [
        ("redb.extractors.js_extractors", [
            "JSFeaturesExtractor",
            "JSSuspiciousAPIsExtractor",
            "JSStringsExtractor",
            "JSDeobfuscationExtractor",
            "JSContentExtractor",
        ]),
    ],
}

# Map filetype labels (from Magika) to registry group names
FILETYPE_TO_GROUP = {
    "pebin": "pe",
    "elf": "elf",
    "macho": "macho",
    "apk": "apk",
    "javascript": "js",
}

# Cache: group name -> {class_name: class}
_group_cache = {}


def _load_group(group_name):
    """Import all extractors for a group. Cached after first call."""
    if group_name in _group_cache:
        return _group_cache[group_name]

    logger.debug(f"Loading extractor group: {group_name}")

    # Suppress androguard logging before importing APK extractors
    if group_name == "apk":
        from loguru import logger as loguru_logger
        loguru_logger.disable("androguard")

    classes = {}
    for module_path, class_names in _REGISTRY[group_name]:
        mod = importlib.import_module(module_path)
        for name in class_names:
            classes[name] = getattr(mod, name)

    _group_cache[group_name] = classes
    return classes


def get_filetype_modules(filetype):
    """Get the list of format-specific extractor classes for a filetype.

    Returns only analysis extractors (excludes decompilers like DecompileAPK).
    """
    group = FILETYPE_TO_GROUP.get(filetype)
    if not group:
        return []
    classes = _load_group(group)
    return [cls for name, cls in classes.items() if not name.startswith("Decompile")]


def get_extractor_class(name):
    """Look up a single extractor class by name across all groups.

    Checks cached groups first, then loads groups on demand.
    """
    # Check already-loaded groups first
    for group_classes in _group_cache.values():
        if name in group_classes:
            return group_classes[name]

    # Search all groups (triggers lazy loading)
    for group_name in _REGISTRY:
        classes = _load_group(group_name)
        if name in classes:
            return classes[name]

    return None