Jacques Guyot

22 papers Journal 4Unranked 16
YearRankTypeTitle / Venue / Authors
2011 ch.
Current Challenges in Patent Information Retrieval
Karim Benzineb, Jacques Guyot
2010 J jnl
J. Inf. Technol. Constr.
Jacques Guyot, Gilles Falquet, Jacques Teller
2010 J jnl
Document Numérique
Nizar Ghoula, Gilles Falquet, Jacques Guyot
2010 ch.
Ontology Theory, Management and Design
Javier Nogueras-Iso, Javier Lacasta, Jacques Teller, Gilles Falquet, Jacques Guyot
2010 conf
Web Intelligence
Nizar Ghoula, Gilles Falquet, Jacques Guyot
2010 conf
CLEF (Notebook Papers/LABs/Workshops)
Jacques Guyot, Karim Benzineb, Gilles Falquet
2009 conf
CLEF (Working Notes)
Jacques Guyot, Gilles Falquet, Karim Benzineb
2009 conf
CLEF (1)
Jacques Guyot, Gilles Falquet, Karim Benzineb
2009 conf
CLEF (Working Notes)
Jacques Guyot, Gilles Falquet, Saïd Radhouani
2008 conf
CLEF
Jacques Guyot, Gilles Falquet, Saïd Radhouani, Karim Benzineb
2008 conf
CLEF (Working Notes)
Jacques Guyot, Gilles Falquet, Saïd Radhouani, Karim Benzineb
2008 conf
EGC
Gilles Falquet, Claire-Lise Mottaz Jiang, Jacques Guyot
2006 J jnl
Ingénierie des Systèmes d Inf.
Jacques Guyot, Gilles Falquet, Karim Benzineb
2005 conf
CLEF
Jacques Guyot, Saïd Radhouani, Gilles Falquet
2005 conf
CLEF (Working Notes)
Jacques Guyot, Saïd Radhouani, Gilles Falquet
1998 conf
WebDB
Gilles Falquet, Jacques Guyot, Luka Nerima
1996 conf
INFORSID
Gilles Falquet, Jacques Guyot, Ian Prince
1991 conf
BDA
Thibault Estier, Jacques Guyot
1988 J jnl
SIGMOD Rec.
Jacques Guyot
1988 conf
Computerized Assistance During the Information Systems Life Cycle
Gilles Falquet, Jacques Guyot, Marc Junet, Michel Léonard, R. Bursens, P. Crausaz, Ian Prince
1987 conf
BDA
R. Bursens, Jacques Guyot
1985 conf
BDA
Michel Léonard, J. Bendavid, Jacques Guyot, Gilles Falquet, Marc Junet, D. T. Luong, P. Papathomas, H. Pham, Jean-Jacques Snella
redb/extractors/js_extractors/js_content.py
← Index redb/extractors/js_extractors/js_content.py python
"""Persists raw + normalised text into the generic `code_text_content` table.

Reads the raw source and the deobfuscation result directly from the shared
JSContext so no extra compute happens here — both values are computed once
per sample (the source at JSContext construction, the deobfuscation lazily
on first access) and reused by any extractor that needs them.

`text_normalized` is left NULL when the deobfuscation pass produced no
output, so analysts can distinguish "we tried and got nothing" from
"normalisation succeeded".
"""

import inspect
from datetime import datetime, timezone
from typing import Any

from redb.extractors.enum import Tag
from redb.extractors.js_extractor import JSExtractor


class JSContentExtractor(JSExtractor):

    def __init__(
        self, filepath, log, exporters=None, index_prefix=None,
        known_benign=False, known_malicious=False, source=None, context=None,
    ):
        super().__init__(
            filepath, log, exporters, index_prefix,
            known_benign, known_malicious, source, context=context,
        )
        self.content_row = None
        self.log.debug(inspect.currentframe().f_code.co_name)

    def tag(self):
        return Tag.JS_CONTENT.value

    def extract(self):
        src = self.js_source
        if not src:
            return None

        deobfuscated, normalizer_used = self._context.deobfuscated

        self.content_row = {
            "content_type": self._context.content_type,
            "text_raw": src,
            "text_normalized": deobfuscated,  # may be None
            "normalizer_used": normalizer_used,  # may be None
        }
        return self.content_row

    def prepare_export_data(self, exporter_type: str) -> Any:
        if exporter_type != "ClickHouseExporter":
            return None
        if not self.content_row:
            return None

        r = self.content_row
        data = [[
            self.sha256,
            r["content_type"],
            r["text_raw"],
            r["text_normalized"],
            r["normalizer_used"],
            datetime.now(timezone.utc),
        ]]

        column_names = [
            "sha256",
            "content_type",
            "text_raw",
            "text_normalized",
            "normalizer_used",
            "analysis_date",
        ]

        column_type_names = [
            "FixedString(64)",
            "LowCardinality(String)",
            "String",
            "Nullable(String)",
            "Nullable(String)",
            "DateTime64(3, 'UTC')",
        ]

        return (data, column_names, column_type_names)

    def get_clickhouse_table(self) -> str:
        return "code_text_content"