C. Li

35 papers A* 1B 2C 1Journal 21Unranked 10
YearRankTypeTitle / Venue / Authors
2025 conf
ICC
C. Li, Chai Kiat Yeo, J. Jing, G. Du, C. Long, J. Zhao, Y. Gao, Y. Wang, L. Gong
2025 J jnl
CoRR
Saeed Mohammadzadeh, Saeed Mashdour, Rodrigo C. de Lamare, K. Cumanan, C. Li
2021 conf
ECOC
Haoshuo Chen, C. Li, Nicolas K. Fontaine, Bob Farah, Cristian A. Bolle, Roland Ryf, Mikael Mazur, Lauren Dallachiesa, David T. Neilson, Oded Raz, Robert Hohenleitner, Christian Neumeyr, Juan Carlos Alvarado-Zacarias, Rodrigo Amezcua Correa, Marianne Bigot-Astruc, Pierre Sillard
2020 C conf
ICCE
C. Li, Arash Pourtaherian, Walther E. Tjon a Ten, Peter H. N. de With
2019 J jnl
Comput. Biol. Medicine
Sasa Kenjeres, J. P. van der Krieke, C. Li
2017 J jnl
IBM J. Res. Dev.
J. Wang, C. Li, S. Han, S. Sarkar, X. Zhou
2017 J jnl
BMC Medical Informatics Decis. Mak.
J. Song, H. Zhao, C. Pan, C. Li, J. Liu, Yaping Pan
2016 conf
OFC
C. Li, T. Li, E. Smalbrugge, Ripalta Stabile, Oded Raz
2016 J jnl
Environ. Model. Softw.
Baishali Dutta, W. N. Smith, B. B. Grant, Elizabeth Pattey, R. L. Desjardins, C. Li
2016 J jnl
Vis. Comput.
Silvia Biasotti, Andrea Cerri, Masaki Aono, A. Ben Hamza, Valeria Garro, Andrea Giachetti, Daniela Giorgi, Afzal Godil, C. Li, Chika Sanada, Michela Spagnuolo, Atsushi Tatsuma, Santiago Velasco-Forero
2016 B conf
AVSS
C. Li, A. Chiang, Gregory Dobler, Yao Wang, Kun Xie, Kaan Ozbay, Masoud Ghandehari, J. Zhou, D. Wang
2015 conf
3DOR@Eurographics
Zhouhui Lian, J. Zhang, Sungbin Choi, Hanan ElNaghy, Jihad El-Sana, Takahiko Furuya, Andrea Giachetti, Riza Alp Güler, Long Lai, C. Li, Haisheng Li, Frederico A. Limberger, Ralph R. Martin, Rafael Umino Nakanishi, Afonso Neto, Luis Gustavo Nonato, Ryutarou Ohbuchi, Kirill Pevzner, David Pickup, Paul L. Rosin, Andrei Sharf, Li Sun, Xianfang Sun, Sibel Tari, Gözde B. Ünal, Richard C. Wilson
2014 conf
3DOR@Eurographics
Bo Li, Yijuan Lu, C. Li, Afzal Godil, Tobias Schreck, Masaki Aono, Martin Burtscher, Hongbo Fu, Takahiko Furuya, Henry Johan, Jianzhuang Liu, Ryutarou Ohbuchi, Atsushi Tatsuma, Changqing Zou
2014 J jnl
Int. J. Commun. Syst.
C. Li, C. Zhao, L. Zhu, H. Lin, J. Li
2014 conf
3DOR@Eurographics
Bo Li, Yijuan Lu, C. Li, Afzal Godil, Tobias Schreck, Masaki Aono, Qiang Chen, Nihad Karim Chowdhury, Bin Fang, Takahiko Furuya, Henry Johan, Ryuichi Kosaka, Hitoshi Koyanagi, Ryutarou Ohbuchi, Atsushi Tatsuma
2014 conf
3DOR@Eurographics
Silvia Biasotti, Andrea Cerri, Mostafa Abdelrahman, Masaki Aono, Abdessamad Ben Hamza, Moumen T. El-Melegy, Aly A. Farag, Valeria Garro, Andrea Giachetti, Daniela Giorgi, Afzal Godil, C. Li, Yong-Jin Liu, H. Y. Martono, Chika Sanada, Atsushi Tatsuma, Santiago Velasco-Forero, Chunxu Xu
2014 conf
3DOR@Eurographics
David Pickup, Xianfang Sun, Paul L. Rosin, Ralph R. Martin, Z. Cheng, Zhouhui Lian, Masaki Aono, Abdessamad Ben Hamza, Alexander M. Bronstein, Michael M. Bronstein, S. Bu, Umberto Castellani, S. Cheng, Valeria Garro, Andrea Giachetti, Afzal Godil, J. Han, Henry Johan, Long Lai, Bo Li, C. Li, Haisheng Li, Roee Litman, X. Liu, Z. Liu, Yijuan Lu, Atsushi Tatsuma, Jianbo Ye
2013 J jnl
J. Optim. Theory Appl.
M. H. Rashid, S. H. Yu, C. Li, S. Y. Wu
2012 J jnl
IET Networks
C. Li, S. Zhang, W. Wang
2012 conf
NEMS
Y. F. Wang, Y. Tian, K. J. Feng, C. Li, D. D. She, W. G. Wu
2011 J jnl
SIAM J. Optim.
D. H. Fang, C. Li, X. Q. Yang
2010 J jnl
Int. J. Comput. Appl. Technol.
Y. Xu, C. Li, Y. J. Shi, H. F. Teng
2010 J jnl
IEEE Trans. Instrum. Meas.
Q. Honglei, Q. Changquan, C. Li, C. Yang
2009 J jnl
SIAM J. Optim.
D. H. Fang, C. Li, Kung Fu Ng
2008 J jnl
Comput. Environ. Urban Syst.
Y. Li, Allan J. Brimicombe, C. Li
2007 B conf
REFSQ
C. Li, J. M. van den Akker, Sjaak Brinkkemper, Guido Diepen
2004 J jnl
Comput. Commun.
L. Li, C. Li
2004 conf
ICC
K. Y. Michael Wong, Gabriel Yik Keung, C. Li, Bo Li
2003 J jnl
Int. J. Comput. Math.
Yiyong Nie, L. J. Su, C. Li
2002 J jnl
Int. J. Netw. Manag.
Sheng-Tzong Cheng, C. Chen, C. Li, Chia-Mei Chen
1998 J jnl
Int. J. Comput. Math.
David J. Evans, C. Li
1990 J jnl
Int. J. Comput. Math.
David J. Evans, C. Li
1990 J jnl
Parallel Comput.
David J. Evans, C. Li
1990 J jnl
Int. J. Comput. Math.
David J. Evans, C. Li
1981 A* conf
ISCA
P. Xia, X. Fang, Y. Wang, G. Wang, Y. Liu, C. Li, C. Lin, W. Zhan, Q. Sun
redb/extractors/js_extractors/js_strings.py
← Index redb/extractors/js_extractors/js_strings.py python
import base64
import bisect
import inspect
import re
from datetime import datetime, timezone
from typing import Any

from redb.extractors.enum import Tag
from redb.extractors.js_extractor import JSExtractor
from redb.extractors.js_extractors.js_patterns import STRING_PATTERNS, line_offsets

# Local aliases for the compiled patterns this extractor uses. Defined and
# compiled exactly once in js_patterns.STRING_PATTERNS.
_HEX_STRING_RE = STRING_PATTERNS["hex_escape_seq"]
_UNICODE_STRING_RE = STRING_PATTERNS["unicode_escape_seq"]
_CHARCODE_RE = STRING_PATTERNS["charcode_call"]
_BASE64_STRING_RE = STRING_PATTERNS["base64_quoted"]
_CONCAT_STRING_RE = STRING_PATTERNS["concat_chain"]

# Tokeniser used inside _reconstruct_concat to pull each quoted part out of a
# matched concat chain. Compiled once at module load (was recompiled on every
# concat match before).
_CONCAT_TOKEN_RE = re.compile(r'["\']([^"\']*)["\']')


class JSStringsExtractor(JSExtractor):

    def __init__(
        self, filepath, log, exporters=None, index_prefix=None,
        known_benign=False, known_malicious=False, source=None, context=None,
    ):
        super().__init__(
            filepath, log, exporters, index_prefix,
            known_benign, known_malicious, source, context=context,
        )
        self.string_findings = None
        self.log.debug(inspect.currentframe().f_code.co_name)

    def tag(self):
        return Tag.JS_STRINGS.value

    def _decode_hex_string(self, hex_str):
        """Decode \\x41\\x42 style hex strings."""
        try:
            # Remove \\x prefix and decode
            clean = hex_str.replace('\\x', '')
            return bytes.fromhex(clean).decode('utf-8', errors='replace')
        except Exception:
            return None

    def _decode_unicode_string(self, uni_str):
        """Decode \\u0041\\u0042 style unicode strings."""
        try:
            return uni_str.encode('utf-8').decode('unicode_escape')
        except Exception:
            return None

    def _decode_charcode(self, charcode_str):
        """Decode String.fromCharCode(72, 101, 108, ...) sequences."""
        try:
            codes = [int(c.strip()) for c in charcode_str.split(',') if c.strip().isdigit()]
            return ''.join(chr(c) for c in codes if 0 <= c <= 0x10FFFF)
        except Exception:
            return None

    def _decode_base64(self, b64_str):
        """Attempt to decode base64 string."""
        try:
            decoded = base64.b64decode(b64_str)
            # Check if result is printable text
            text = decoded.decode('utf-8', errors='strict')
            # Only return if it looks like text (>80% printable)
            printable = sum(1 for c in text if c.isprintable() or c in '\n\r\t')
            if printable / len(text) > 0.8:
                return text
        except Exception:
            pass
        return None

    def _reconstruct_concat(self, concat_match):
        """Reconstruct concatenated string parts."""
        try:
            parts = _CONCAT_TOKEN_RE.findall(concat_match)
            return ''.join(parts)
        except Exception:
            return None

    def _find_line_number(self, match_start):
        """1-indexed line number for `match_start`, looked up in O(log L) via
        bisect over `self._line_offsets` (built once per extract() call).

        Replaces the historical `self.js_source[:match_start].count('\\n') + 1`
        which was O(N) per call and quadratic across all matches in a sample.
        """
        return bisect.bisect_right(self._line_offsets, match_start)

    def _scan_text(self, text):
        """Run every encoded-string pattern over `text` and return a list of
        finding dicts. Stateless apart from the per-call `_line_offsets` cache,
        which `_find_line_number` reads — callers must reset it before invoking
        this so line numbers reference the text being scanned, not the previous
        one.
        """
        findings = []

        # Hex-encoded strings
        for m in _HEX_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_hex_string(raw)
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'hex',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Unicode-encoded strings
        for m in _UNICODE_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_unicode_string(raw)
            if decoded and len(decoded) >= 3:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'unicode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # String.fromCharCode sequences
        for m in _CHARCODE_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_charcode(m.group(1))
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'charcode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Base64-encoded strings
        for m in _BASE64_STRING_RE.finditer(text):
            raw = m.group(0)
            b64_val = m.group(1)
            decoded = self._decode_base64(b64_val)
            if decoded and len(decoded) >= 10:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'base64',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Concatenated strings (reassembled)
        for m in _CONCAT_STRING_RE.finditer(text):
            raw = m.group()
            reconstructed = self._reconstruct_concat(raw)
            if reconstructed and len(reconstructed) >= 20:
                findings.append({
                    'string': reconstructed[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'concat',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(reconstructed),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(reconstructed),
                })

        return findings

    def extract(self):
        src = self.js_source
        if not src:
            return None

        # Pass 1: raw source. _line_offsets is keyed off whichever text is
        # currently being scanned so _find_line_number resolves to that text.
        self._line_offsets = line_offsets(src)
        findings = self._scan_text(src)

        # Pass 2: deobfuscated text, when the deobfuscator produced something
        # meaningfully different. Same patterns, but a different surface — for
        # samples where the encoded payload is hidden behind an outer wrapper
        # (e.g. array.join() + eval in Vjw0rm/WSH-RAT) only this pass yields
        # any rows at all.
        deobf_text, _ = self._context.deobfuscated
        if deobf_text and deobf_text != src:
            self._line_offsets = line_offsets(deobf_text)
            findings.extend(self._scan_text(deobf_text))

        if not findings:
            return None

        # Deduplicate by decoded string value (raw pass wins on collision: it
        # comes first in `findings`). A string that surfaces only in the
        # deobfuscated text still gets persisted, which is the whole point of
        # the second pass.
        seen_values = set()
        deduped = []
        for f in findings:
            val_key = f['string'][:100]
            if val_key not in seen_values:
                seen_values.add(val_key)
                deduped.append(f)

        self.string_findings = deduped[:500]  # Limit per file
        # Publish to the shared context so post-loop consumers (notably the IOC
        # plumbing in workers.py) can scrape the decoded strings without
        # holding a reference to this extractor instance.
        self._context.decoded_strings = self.string_findings
        return self.string_findings

    def prepare_export_data(self, exporter_type: str) -> Any:
        if exporter_type == "ClickHouseExporter":
            if not self.string_findings:
                return None

            data = []
            for f in self.string_findings:
                data.append([
                    self.sha256,
                    f['string'],
                    f['string_raw'],
                    f['string_encoding'],
                    f['string_offset'],
                    f['string_length'],
                    f['string_raw_length'],
                    f['string_entropy'],
                ])

            column_names = [
                "sha256",
                "string",
                "string_raw",
                "string_encoding",
                "string_offset",
                "string_length",
                "string_raw_length",
                "string_entropy",
            ]

            column_type_names = [
                "FixedString(64)",
                "String",
                "String",
                "LowCardinality(String)",
                "UInt64",
                "UInt32",
                "UInt32",
                "Float32",
            ]

            return (data, column_names, column_type_names)

    def get_clickhouse_table(self) -> str:
        return "code_binja_strings_raw"