Xiao Qin

44 papers Misc 1Journal 20Unranked 23
YearRankTypeTitle / Venue / Authors
2025 J jnl
Knowl. Based Syst.
Jianbo Zhao, Yuzhong Peng, Zongbao Yang, Zhichen Chen, Changan Yuan, Xiao Qin, Ruxin Wang, Hao Zhang
2025 J jnl
Frontiers Comput. Sci.
Shaojie Qiao, Han-Lin Fan, Nan Han, Lan Du, Yu-Han Peng, Rong-Min Tang, Xiao Qin
2025 J jnl
IEEE Trans. Medical Imaging
Xiaosen Li, Linli Li, Xinlong Xing, Huixian Liao, Wenji Wang, Qiutong Dong, Xiao Qin, Chang-An Yuan
2024 J jnl
Comput. Methods Programs Biomed.
Zipiao Zhu, Yang Liu, Chang-An Yuan, Xiao Qin, Feng Yang
2024 J jnl
Appl. Soft Comput.
Shaojie Qiao, Nan Han, Jiangtao Huang, Yuzhong Peng, Hongguo Cai, Xiao Qin, Zhengyi Lei
2024 J jnl
Pattern Recognit. Lett.
Xiao Qin, Changan Yuan, Jianhui Jiang, Long Chen
2024 J jnl
Image Vis. Comput.
Huixian Liao, Xiaosen Li, Xiao Qin, Wenji Wang, Guodui He, Haojie Huang, Xu Guo, Xin Chun, Jinyong Zhang, Yunqin Fu, Zhengyou Qin
2023 J jnl
Neurocomputing
Long Chen, Chang-An Yuan, Xiao Qin, Wei Sun, Xiaofeng Zhu
2023 J jnl
IEEE Trans. Biom. Behav. Identity Sci.
Yong Wu, Guo-Dui He, Li-Hua Wen, Xiao Qin, Chang-An Yuan, Valeriya V. Gribova, Vladimir Fedorovich Filaretov, De-Shuang Huang
2023 J jnl
Comput. Biol. Medicine
Xiaosen Li, Xiao Qin, Chengliang Huang, Yuer Lu, Jinyan Cheng, Liansheng Wang, Ou Liu, Jianwei Shuai, Chang-An Yuan
2021 conf
ICIC (1)
Xiao Qin, Yu Shi, Xiao Huang, Huiting Li, Jiangtao Huang, Changan Yuan, Chunxia Liu
2021 J jnl
IEEE Trans. Cogn. Dev. Syst.
Yong Wu, Kun Zhang, Di Wu, Chao Wang, Chang-An Yuan, Xiao Qin, Tao Zhu, Yuchuan Du, Hanli Wang, De-Shuang Huang
2021 conf
ICIC (1)
Wenhui Liu, Changan Yuan, Xiao Qin, Hongjie Wu
2021 conf
ICIC (1)
Si-Zhe Wan, Changan Yuan, Xiao Qin, Hongjie Wu
2021 conf
ICIC (3)
Youhong Xu, Qinghu Zhang, Zhanheng Chen, Chang-An Yuan, Xiao Qin, Hongjie Wu
2020 conf
ICIC (1)
Xiao Qin, Chengcheng Huang, Junhua Wu, Changan Yuan
2020 conf
ICIC (2)
Siguo Wang, Zhen Shen, Ying He, Qinhu Zhang, Changan Yuan, Xiao Qin, Hongjie Wu, Xingming Zhao
2020 J jnl
IEEE Access
Xiao Qin, Jianhui Jiang, Chang-An Yuan, Shaojie Qiao, Wei Fan
2020 conf
ICIC (1)
Zhipeng Li, Fei Wang, Hamdan Taleb, Changan Yuan, Xiao Qin, Hongjie Wu, Xingming Zhao, Lijun Zhang
2020 conf
ICIC (1)
Hongwei Yang, Di Wu, Changan Yuan, Xiao Qin, Hongjie Wu, Xingming Zhao, Zhongqiu Zhao
2020 conf
ICIC (1)
Yong Wu, Si-Zhe Wan, Di Wu, Chao Wang, Changan Yuan, Xiao Qin, Hongjie Wu, Xingming Zhao
2020 conf
ICIC (2)
Yindong Zhang, Qinhu Zhang, Changan Yuan, Xiao Qin, Hongjie Wu, Xingming Zhao
2020 conf
ICIC (1)
Kun Zhang, Di Wu, Changan Yuan, Xiao Qin, Hongjie Wu, Xingming Zhao, Lijun Zhang, Yuchuan Du, Hanli Wang
2020 conf
ICIC (2)
Ying He, Zhen Shen, Qinhu Zhang, Siguo Wang, Changan Yuan, Xiao Qin, Hongjie Wu, Xingming Zhao
2019 J jnl
IEEE Access
Changan Yuan, Xiao Qin, Lechan Yang, Guangwei Gao, Song Deng
2019 J jnl
Int. J. Comput. Intell. Syst.
Yuzhong Peng, Huasheng Zhao, Hao Zhang, Wenwei Li, Xiao Qin, Jianping Liao, Zhiping Liu, Jie Li
2019 J jnl
Appl. Intell.
Changan Yuan, Yong Wu, Xiao Qin, Shaojie Qiao, Yonghua Pan, Ping Huang, Dunhu Liu, Nan Han
2019 J jnl
Future Gener. Comput. Syst.
Song Deng, Changan Yuan, Lechan Yang, Xiao Qin, Aihua Zhou
2019 conf
ICIC (3)
Wei Qin, Xue Cui, Chang-An Yuan, Xiao Qin, Li Shang, Zhi-Kai Huang, Si-Zhe Wan
2019 conf
ICIC (2)
Wenbo Yu, Chang-An Yuan, Xiao Qin, Zhi-Kai Huang, Li Shang
2019 J jnl
Multim. Tools Appl.
Xiao Qin, Wanting Ji, Ruili Wang, Changan Yuan
2019 conf
ICIC (2)
Dailun Wang, Qinhu Zhang, Chang-An Yuan, Xiao Qin, Zhi-Kai Huang, Li Shang
2019 J jnl
IEEE Access
Di Wu, Hong-Wei Yang, De-Shuang Huang, Chang-An Yuan, Xiao Qin, Yang Zhao, Xin-Yong Zhao, Jian-Hong Sun
2019 conf
ICIC (1)
Zhihao Jiao, Lijun Zhang, Chang-An Yuan, Xiao Qin, Li Shang
2019 conf
ICIC (2)
Yu-zhong Peng, Chuyan Deng, Hongya Li, Daoqing Gong, Xiao Qin, Li Cai
2018 conf
ICIC (3)
Di Wu, Si-Jia Zheng, Fei Cheng, Yang Zhao, Chang-An Yuan, Xiao Qin, Yong-Li Jiang, De-Shuang Huang
2018 conf
ICIC (3)
Si-Jia Zheng, Di Wu, Fei Cheng, Yang Zhao, Chang-An Yuan, Xiao Qin, De-Shuang Huang
2018 conf
ELM
Yuzhong Peng, Huasheng Zhao, Jie Li, Xiao Qin, Jianping Liao, Zhiping Liu
2018 conf
ICIC (3)
Dezhu Li, Hongwei Yang, Chang-An Yuan, Xiao Qin
2017 J jnl
计算机科学
Xiao Qin, Wei Liang, Changan Yuan, Tao Tang
2014 J jnl
Neurocomputing
Yu-zhong Peng, Chang-An Yuan, Xiao Qin, Jiangtao Huang, Yabing Shi
2009 conf
WGEC
Chao Ding, Chang-An Yuan, Xiao Qin, Yu-zhong Peng
2009 Misc conf
GrC
Guangyuan Li, Xiao Qin, Qinbin Hu, Changan Yuan
2008 conf
CSSE (1)
Yu-zhong Peng, Chang-An Yuan, Yan Wang, Xiao Qin
redb/extractors/js_extractors/js_strings.py
← Index redb/extractors/js_extractors/js_strings.py python
import base64
import bisect
import inspect
import re
from datetime import datetime, timezone
from typing import Any

from redb.extractors.enum import Tag
from redb.extractors.js_extractor import JSExtractor
from redb.extractors.js_extractors.js_patterns import STRING_PATTERNS, line_offsets

# Local aliases for the compiled patterns this extractor uses. Defined and
# compiled exactly once in js_patterns.STRING_PATTERNS.
_HEX_STRING_RE = STRING_PATTERNS["hex_escape_seq"]
_UNICODE_STRING_RE = STRING_PATTERNS["unicode_escape_seq"]
_CHARCODE_RE = STRING_PATTERNS["charcode_call"]
_BASE64_STRING_RE = STRING_PATTERNS["base64_quoted"]
_CONCAT_STRING_RE = STRING_PATTERNS["concat_chain"]

# Tokeniser used inside _reconstruct_concat to pull each quoted part out of a
# matched concat chain. Compiled once at module load (was recompiled on every
# concat match before).
_CONCAT_TOKEN_RE = re.compile(r'["\']([^"\']*)["\']')


class JSStringsExtractor(JSExtractor):

    def __init__(
        self, filepath, log, exporters=None, index_prefix=None,
        known_benign=False, known_malicious=False, source=None, context=None,
    ):
        super().__init__(
            filepath, log, exporters, index_prefix,
            known_benign, known_malicious, source, context=context,
        )
        self.string_findings = None
        self.log.debug(inspect.currentframe().f_code.co_name)

    def tag(self):
        return Tag.JS_STRINGS.value

    def _decode_hex_string(self, hex_str):
        """Decode \\x41\\x42 style hex strings."""
        try:
            # Remove \\x prefix and decode
            clean = hex_str.replace('\\x', '')
            return bytes.fromhex(clean).decode('utf-8', errors='replace')
        except Exception:
            return None

    def _decode_unicode_string(self, uni_str):
        """Decode \\u0041\\u0042 style unicode strings."""
        try:
            return uni_str.encode('utf-8').decode('unicode_escape')
        except Exception:
            return None

    def _decode_charcode(self, charcode_str):
        """Decode String.fromCharCode(72, 101, 108, ...) sequences."""
        try:
            codes = [int(c.strip()) for c in charcode_str.split(',') if c.strip().isdigit()]
            return ''.join(chr(c) for c in codes if 0 <= c <= 0x10FFFF)
        except Exception:
            return None

    def _decode_base64(self, b64_str):
        """Attempt to decode base64 string."""
        try:
            decoded = base64.b64decode(b64_str)
            # Check if result is printable text
            text = decoded.decode('utf-8', errors='strict')
            # Only return if it looks like text (>80% printable)
            printable = sum(1 for c in text if c.isprintable() or c in '\n\r\t')
            if printable / len(text) > 0.8:
                return text
        except Exception:
            pass
        return None

    def _reconstruct_concat(self, concat_match):
        """Reconstruct concatenated string parts."""
        try:
            parts = _CONCAT_TOKEN_RE.findall(concat_match)
            return ''.join(parts)
        except Exception:
            return None

    def _find_line_number(self, match_start):
        """1-indexed line number for `match_start`, looked up in O(log L) via
        bisect over `self._line_offsets` (built once per extract() call).

        Replaces the historical `self.js_source[:match_start].count('\\n') + 1`
        which was O(N) per call and quadratic across all matches in a sample.
        """
        return bisect.bisect_right(self._line_offsets, match_start)

    def _scan_text(self, text):
        """Run every encoded-string pattern over `text` and return a list of
        finding dicts. Stateless apart from the per-call `_line_offsets` cache,
        which `_find_line_number` reads — callers must reset it before invoking
        this so line numbers reference the text being scanned, not the previous
        one.
        """
        findings = []

        # Hex-encoded strings
        for m in _HEX_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_hex_string(raw)
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'hex',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Unicode-encoded strings
        for m in _UNICODE_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_unicode_string(raw)
            if decoded and len(decoded) >= 3:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'unicode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # String.fromCharCode sequences
        for m in _CHARCODE_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_charcode(m.group(1))
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'charcode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Base64-encoded strings
        for m in _BASE64_STRING_RE.finditer(text):
            raw = m.group(0)
            b64_val = m.group(1)
            decoded = self._decode_base64(b64_val)
            if decoded and len(decoded) >= 10:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'base64',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Concatenated strings (reassembled)
        for m in _CONCAT_STRING_RE.finditer(text):
            raw = m.group()
            reconstructed = self._reconstruct_concat(raw)
            if reconstructed and len(reconstructed) >= 20:
                findings.append({
                    'string': reconstructed[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'concat',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(reconstructed),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(reconstructed),
                })

        return findings

    def extract(self):
        src = self.js_source
        if not src:
            return None

        # Pass 1: raw source. _line_offsets is keyed off whichever text is
        # currently being scanned so _find_line_number resolves to that text.
        self._line_offsets = line_offsets(src)
        findings = self._scan_text(src)

        # Pass 2: deobfuscated text, when the deobfuscator produced something
        # meaningfully different. Same patterns, but a different surface — for
        # samples where the encoded payload is hidden behind an outer wrapper
        # (e.g. array.join() + eval in Vjw0rm/WSH-RAT) only this pass yields
        # any rows at all.
        deobf_text, _ = self._context.deobfuscated
        if deobf_text and deobf_text != src:
            self._line_offsets = line_offsets(deobf_text)
            findings.extend(self._scan_text(deobf_text))

        if not findings:
            return None

        # Deduplicate by decoded string value (raw pass wins on collision: it
        # comes first in `findings`). A string that surfaces only in the
        # deobfuscated text still gets persisted, which is the whole point of
        # the second pass.
        seen_values = set()
        deduped = []
        for f in findings:
            val_key = f['string'][:100]
            if val_key not in seen_values:
                seen_values.add(val_key)
                deduped.append(f)

        self.string_findings = deduped[:500]  # Limit per file
        # Publish to the shared context so post-loop consumers (notably the IOC
        # plumbing in workers.py) can scrape the decoded strings without
        # holding a reference to this extractor instance.
        self._context.decoded_strings = self.string_findings
        return self.string_findings

    def prepare_export_data(self, exporter_type: str) -> Any:
        if exporter_type == "ClickHouseExporter":
            if not self.string_findings:
                return None

            data = []
            for f in self.string_findings:
                data.append([
                    self.sha256,
                    f['string'],
                    f['string_raw'],
                    f['string_encoding'],
                    f['string_offset'],
                    f['string_length'],
                    f['string_raw_length'],
                    f['string_entropy'],
                ])

            column_names = [
                "sha256",
                "string",
                "string_raw",
                "string_encoding",
                "string_offset",
                "string_length",
                "string_raw_length",
                "string_entropy",
            ]

            column_type_names = [
                "FixedString(64)",
                "String",
                "String",
                "LowCardinality(String)",
                "UInt64",
                "UInt32",
                "UInt32",
                "Float32",
            ]

            return (data, column_names, column_type_names)

    def get_clickhouse_table(self) -> str:
        return "code_binja_strings_raw"