Xi Yang

77 papers A* 10A 2B 1Journal 50Unranked 14
YearRankTypeTitle / Venue / Authors
2026 J jnl
Cogn. Comput.
Chengrui Zhang, Zhaorui Tan, Xi Yang, Liqiong Yuan, Zhanbao Su, Amir Hussain, Yifei Zhang, Bin Dong, Jie Sun, Kaizhu Huang
2026 J jnl
Neural Networks
Penglei Gao, Rui Zhang, Xi Yang, Zhuang Qian, Kaizhu Huang
2026 J jnl
IEEE J. Biomed. Health Informatics
Tianyi Liu, Zhaorui Tan, Muyin Chen, Xi Yang, Haochuan Jiang, Kaizhu Huang
2025 conf
ICONIP (1)
Yihao Zhang, Youpeng Yang, Hao Lan Zhang, Dongming Lu, Taoyu Wu, Xi Yang
2025 J jnl
CoRR
Chenru Jiang, Chengrui Zhang, Xi Yang, Jie Sun, Yifei Zhang, Bin Dong, Kaizhu Huang
2025 A* conf
AAAI
Jianan Ye, Zhaorui Tan, Yijie Hu, Xi Yang, Guangliang Cheng, Kaizhu Huang
2025 conf
ICONIP (5)
Jinming Zhang, Yuyao Yan, Xi Yang, Kaizhu Huang
2025 J jnl
CoRR
Zhaorui Tan, Tan Pan, Kaizhu Huang, Weimiao Yu, Kai Yao, Chen Jiang, Qiu-Feng Wang, Anh Nguyen, Xin Guo, Yuan Cheng, Xi Yang
2025 A conf
ICME
Weiguang Zhao, Chaolong Yang, Jianan Ye, Rui Zhang, Yuyao Yan, Xi Yang, Bin Dong, Amir Hussain, Kaizhu Huang
2025 A* conf
CVPR
Jianan Ye, Weiguang Zhao, Xi Yang, Guangliang Cheng, Kaizhu Huang
2025 J jnl
CoRR
Zhenglin Huang, Jason Li, Haiquan Wen, Tianxiao Li, Xi Yang, Lu Qi, Bei Peng, Xiaowei Huang, Ming-Hsuan Yang, Guangliang Cheng
2025 J jnl
Pattern Recognit.
Chenru Jiang, Wuwei Ma, Kaizhu Huang, Qiufeng Wang, Xi Yang, Weiguang Zhao, Junwei Wu, Xinheng Wang, Jimin Xiao, Zhenxing Niu
2025 J jnl
IEEE Trans. Neural Networks Learn. Syst.
Kai Yao, Zhaorui Tan, Zixian Su, Xi Yang, Jie Sun, Kaizhu Huang
2025 J jnl
CoRR
Zhaorui Tan, Yijie Hu, Xi Yang, Qiufeng Wang, Anh Nguyen, Kaizhu Huang
2025 J jnl
CoRR
Zhenglin Huang, Tianxiao Li, Xiangtai Li, Haiquan Wen, Yiwei He, Jiangning Zhang, Hao Fei, Xi Yang, Xiaowei Huang, Bei Peng, Guangliang Cheng
2025 conf
ICONIP (5)
Yining Sun, Penglei Gao, Yuyao Yan, Xi Yang
2025 A* conf
ACM Multimedia
Xinzhe Xia, Weiguang Zhao, Yuyao Yan, Guanyu Yang, Rui Zhang, Kaizhu Huang, Xi Yang
2025 J jnl
CoRR
Xinzhe Xia, Weiguang Zhao, Yuyao Yan, Guanyu Yang, Rui Zhang, Kaizhu Huang, Xi Yang
2024 J jnl
ACM Trans. Multim. Comput. Commun. Appl.
Penglei Gao, Xi Yang, Rui Zhang, Kaizhu Huang
2024 J jnl
CoRR
Zixian Su, Jingwei Guo, Xi Yang, Qiufeng Wang, Kaizhu Huang
2024 J jnl
CoRR
Jianan Ye, Zhaorui Tan, Yijie Hu, Xi Yang, Guangliang Cheng, Kaizhu Huang
2024 J jnl
IEEE Trans. Cybern.
Penglei Gao, Xi Yang, Rui Zhang, Ping Guo, John Yannis Goulermas, Kaizhu Huang
2024 conf
ICONIP (11)
Yiqun Ma, Wenrui Wang, Siyuan Wang, Xi Yang, Yuyao Yan
2024 J jnl
Neural Comput.
Guanyu Yang, Kaizhu Huang, Rui Zhang, Xi Yang
2024 A* conf
NeurIPS
Zhaorui Tan, Xi Yang, Qiufeng Wang, Anh Nguyen, Kaizhu Huang
2024 J jnl
CoRR
Zhaorui Tan, Xi Yang, Qiufeng Wang, Anh Nguyen, Kaizhu Huang
2024 J jnl
CoRR
Tianyi Liu, Zhaorui Tan, Muyin Chen, Xi Yang, Haochuan Jiang, Kaizhu Huang
2024 conf
BIBM
Tianyi Liu, Zhaorui Tan, Haochuan Jiang, Xi Yang, Kaizhu Huang
2024 J jnl
CoRR
Tianyi Liu, Zhaorui Tan, Haochuan Jiang, Xi Yang, Kaizhu Huang
2024 J jnl
CoRR
Zixian Su, Jingwei Guo, Xi Yang, Qiu-Feng Wang, Frans Coenen, Kaizhu Huang
2024 J jnl
CoRR
Jianan Ye, Weiguang Zhao, Xi Yang, Guangliang Cheng, Kaizhu Huang
2024 J jnl
CoRR
Zhaorui Tan, Xi Yang, Tan Pan, Tianyi Liu, Chen Jiang, Xin Guo, Qiufeng Wang, Anh Nguyen, Yuan Qi, Kaizhu Huang, Yuan Cheng
2024 A* conf
CVPR
Zhaorui Tan, Xi Yang, Kaizhu Huang
2024 J jnl
CoRR
Zhaorui Tan, Xi Yang, Kaizhu Huang
2024 J jnl
CoRR
Zhaorui Tan, Chengrui Zhang, Xi Yang, Jie Sun, Kaizhu Huang
2024 J jnl
CoRR
Kai Yao, Zhaorui Tan, Zixian Su, Xi Yang, Jie Sun, Kaizhu Huang
2024 J jnl
Pattern Recognit.
Jianan Ye, Yijie Hu, Xi Yang, Qiu-Feng Wang, Chao Huang, Kaizhu Huang
2024 A* conf
AAAI
Zhaorui Tan, Xi Yang, Kaizhu Huang
2024 A* conf
AAAI
Zixian Su, Jingwei Guo, Kai Yao, Xi Yang, Qiufeng Wang, Kaizhu Huang
2023 conf
ICONIP (4)
Taowen Wang, Zhuang Qian, Xi Yang
2023 conf
BICS
Sidong Jiang, Siyuan Wang, Rui Zhang, Xi Yang, Kaizhu Huang
2023 A* conf
ICCV
Weiguang Zhao, Yuyao Yan, Chaolong Yang, Jianan Ye, Xi Yang, Kaizhu Huang
2023 J jnl
IEEE Trans. Knowl. Data Eng.
Penglei Gao, Xi Yang, Rui Zhang, Kaizhu Huang, John Yannis Goulermas
2023 A conf
CIKM
Kai Yao, Zixian Su, Xi Yang, Jie Sun, Kaizhu Huang
2023 J jnl
Neural Networks
Penglei Gao, Xi Yang, Rui Zhang, John Yannis Goulermas, Yujie Geng, Yuyao Yan, Kaizhu Huang
2023 J jnl
IEEE J. Biomed. Health Informatics
Zixian Su, Kai Yao, Xi Yang, Qiufeng Wang, Yuyao Yan, Jie Sun, Kaizhu Huang
2023 conf
ICONIP (4)
Zhaorui Tan, Siyuan Wang, Xi Yang, Kaizhu Huang
2023 A* conf
AAAI
Zixian Su, Kai Yao, Xi Yang, Kaizhu Huang, Qiufeng Wang, Jie Sun
2023 J jnl
CoRR
Jianan Ye, Yijie Hu, Xi Yang, Qiu-Feng Wang, Chao Huang, Kaizhu Huang
2023 J jnl
Pattern Recognit.
Zhaorui Tan, Xi Yang, Zihan Ye, Qiufeng Wang, Yuyao Yan, Anh Nguyen, Kaizhu Huang
2023 J jnl
CoRR
Zhaorui Tan, Xi Yang, Kaizhu Huang
2023 conf
ICONIP (15)
Chaolong Yang, Yuyao Yan, Weiguang Zhao, Jianan Ye, Xi Yang, Amir Hussain, Bin Dong, Kaizhu Huang
2023 J jnl
Pattern Recognit.
Jing Li, Qiu-Feng Wang, Kaizhu Huang, Xi Yang, Rui Zhang, John Yannis Goulermas
2023 J jnl
CoRR
Zixian Su, Jingwei Guo, Kai Yao, Xi Yang, Qiufeng Wang, Kaizhu Huang
2022 J jnl
CoRR
Rui Qiu, Ming Xu, Yuyao Yan, Jeremy S. Smith, Xi Yang
2022 conf
ECCV (10)
Rui Qiu, Ming Xu, Yuyao Yan, Jeremy S. Smith, Xi Yang
2022 J jnl
IEEE J. Biomed. Health Informatics
Kai Yao, Zixian Su, Kaizhu Huang, Xi Yang, Jie Sun, Amir Hussain, Frans Coenen
2022 J jnl
CoRR
Weiguang Zhao, Yuyao Yan, Chaolong Yang, Jianan Ye, Xi Yang, Kaizhu Huang
2022 J jnl
CoRR
Penglei Gao, Xi Yang, Kaizhu Huang, Rui Zhang, Ping Guo, John Yannis Goulermas
2022 J jnl
CoRR
Weiguang Zhao, Chaolong Yang, Jianan Ye, Yuyao Yan, Xi Yang, Kaizhu Huang
2022 J jnl
CoRR
Penglei Gao, Xi Yang, Rui Zhang, Kaizhu Huang, Yujie Geng
2022 J jnl
CoRR
Zixian Su, Kai Yao, Xi Yang, Qiufeng Wang, Yuyao Yan, Kaizhu Huang
2022 conf
ECCV (23)
Kai Yao, Penglei Gao, Xi Yang, Jie Sun, Rui Zhang, Kaizhu Huang
2022 J jnl
CoRR
Kai Yao, Penglei Gao, Xi Yang, Kaizhu Huang, Jie Sun, Rui Zhang
2022 J jnl
CoRR
Zixian Su, Kai Yao, Xi Yang, Qiufeng Wang, Jie Sun, Kaizhu Huang
2022 J jnl
CoRR
Zhaorui Tan, Zihan Ye, Xi Yang, Qiufeng Wang, Yuyao Yan, Kaizhu Huang
2022 J jnl
CoRR
Chaolong Yang, Yuyao Yan, Weiguang Zhao, Jianan Ye, Xi Yang, Amir Hussain, Kaizhu Huang
2020 J jnl
CoRR
Penglei Gao, Xi Yang, Rui Zhang, Kaizhu Huang
2019 J jnl
Cogn. Comput.
Xi Yang, Kaizhu Huang, Rui Zhang, John Yannis Goulermas
2019 A* conf
ICDM
Xi Yang, Yuyao Yan, Kaizhu Huang, Rui Zhang
2018 J jnl
Neurocomputing
Xi Yang, Kaizhu Huang, Rui Zhang, John Yannis Goulermas, Amir Hussain
2018 J jnl
IEEE Trans. Emerg. Top. Comput. Intell.
Xi Yang, Kaizhu Huang, Rui Zhang, Amir Hussain
2017 conf
ICONIP (1)
Xi Yang, Kaizhu Huang, Rui Zhang
2017 J jnl
Neural Process. Lett.
Xi Yang, Kaizhu Huang, John Yannis Goulermas, Rui Zhang
2016 conf
ICONIP (1)
Xi Yang, Kaizhu Huang, Rui Zhang, Amir Hussain
2015 B conf
IJCNN
Xi Yang, Kaizhu Huang, Rui Zhang, John Yannis Goulermas
2014 conf
ICONIP (2)
Xi Yang, Kaizhu Huang, Rui Zhang
redb/extractors/js_extractors/js_strings.py
← Index redb/extractors/js_extractors/js_strings.py python
import base64
import bisect
import inspect
import re
from datetime import datetime, timezone
from typing import Any

from redb.extractors.enum import Tag
from redb.extractors.js_extractor import JSExtractor
from redb.extractors.js_extractors.js_patterns import STRING_PATTERNS, line_offsets

# Local aliases for the compiled patterns this extractor uses. Defined and
# compiled exactly once in js_patterns.STRING_PATTERNS.
_HEX_STRING_RE = STRING_PATTERNS["hex_escape_seq"]
_UNICODE_STRING_RE = STRING_PATTERNS["unicode_escape_seq"]
_CHARCODE_RE = STRING_PATTERNS["charcode_call"]
_BASE64_STRING_RE = STRING_PATTERNS["base64_quoted"]
_CONCAT_STRING_RE = STRING_PATTERNS["concat_chain"]

# Tokeniser used inside _reconstruct_concat to pull each quoted part out of a
# matched concat chain. Compiled once at module load (was recompiled on every
# concat match before).
_CONCAT_TOKEN_RE = re.compile(r'["\']([^"\']*)["\']')


class JSStringsExtractor(JSExtractor):

    def __init__(
        self, filepath, log, exporters=None, index_prefix=None,
        known_benign=False, known_malicious=False, source=None, context=None,
    ):
        super().__init__(
            filepath, log, exporters, index_prefix,
            known_benign, known_malicious, source, context=context,
        )
        self.string_findings = None
        self.log.debug(inspect.currentframe().f_code.co_name)

    def tag(self):
        return Tag.JS_STRINGS.value

    def _decode_hex_string(self, hex_str):
        """Decode \\x41\\x42 style hex strings."""
        try:
            # Remove \\x prefix and decode
            clean = hex_str.replace('\\x', '')
            return bytes.fromhex(clean).decode('utf-8', errors='replace')
        except Exception:
            return None

    def _decode_unicode_string(self, uni_str):
        """Decode \\u0041\\u0042 style unicode strings."""
        try:
            return uni_str.encode('utf-8').decode('unicode_escape')
        except Exception:
            return None

    def _decode_charcode(self, charcode_str):
        """Decode String.fromCharCode(72, 101, 108, ...) sequences."""
        try:
            codes = [int(c.strip()) for c in charcode_str.split(',') if c.strip().isdigit()]
            return ''.join(chr(c) for c in codes if 0 <= c <= 0x10FFFF)
        except Exception:
            return None

    def _decode_base64(self, b64_str):
        """Attempt to decode base64 string."""
        try:
            decoded = base64.b64decode(b64_str)
            # Check if result is printable text
            text = decoded.decode('utf-8', errors='strict')
            # Only return if it looks like text (>80% printable)
            printable = sum(1 for c in text if c.isprintable() or c in '\n\r\t')
            if printable / len(text) > 0.8:
                return text
        except Exception:
            pass
        return None

    def _reconstruct_concat(self, concat_match):
        """Reconstruct concatenated string parts."""
        try:
            parts = _CONCAT_TOKEN_RE.findall(concat_match)
            return ''.join(parts)
        except Exception:
            return None

    def _find_line_number(self, match_start):
        """1-indexed line number for `match_start`, looked up in O(log L) via
        bisect over `self._line_offsets` (built once per extract() call).

        Replaces the historical `self.js_source[:match_start].count('\\n') + 1`
        which was O(N) per call and quadratic across all matches in a sample.
        """
        return bisect.bisect_right(self._line_offsets, match_start)

    def _scan_text(self, text):
        """Run every encoded-string pattern over `text` and return a list of
        finding dicts. Stateless apart from the per-call `_line_offsets` cache,
        which `_find_line_number` reads — callers must reset it before invoking
        this so line numbers reference the text being scanned, not the previous
        one.
        """
        findings = []

        # Hex-encoded strings
        for m in _HEX_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_hex_string(raw)
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'hex',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Unicode-encoded strings
        for m in _UNICODE_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_unicode_string(raw)
            if decoded and len(decoded) >= 3:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'unicode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # String.fromCharCode sequences
        for m in _CHARCODE_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_charcode(m.group(1))
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'charcode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Base64-encoded strings
        for m in _BASE64_STRING_RE.finditer(text):
            raw = m.group(0)
            b64_val = m.group(1)
            decoded = self._decode_base64(b64_val)
            if decoded and len(decoded) >= 10:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'base64',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Concatenated strings (reassembled)
        for m in _CONCAT_STRING_RE.finditer(text):
            raw = m.group()
            reconstructed = self._reconstruct_concat(raw)
            if reconstructed and len(reconstructed) >= 20:
                findings.append({
                    'string': reconstructed[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'concat',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(reconstructed),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(reconstructed),
                })

        return findings

    def extract(self):
        src = self.js_source
        if not src:
            return None

        # Pass 1: raw source. _line_offsets is keyed off whichever text is
        # currently being scanned so _find_line_number resolves to that text.
        self._line_offsets = line_offsets(src)
        findings = self._scan_text(src)

        # Pass 2: deobfuscated text, when the deobfuscator produced something
        # meaningfully different. Same patterns, but a different surface — for
        # samples where the encoded payload is hidden behind an outer wrapper
        # (e.g. array.join() + eval in Vjw0rm/WSH-RAT) only this pass yields
        # any rows at all.
        deobf_text, _ = self._context.deobfuscated
        if deobf_text and deobf_text != src:
            self._line_offsets = line_offsets(deobf_text)
            findings.extend(self._scan_text(deobf_text))

        if not findings:
            return None

        # Deduplicate by decoded string value (raw pass wins on collision: it
        # comes first in `findings`). A string that surfaces only in the
        # deobfuscated text still gets persisted, which is the whole point of
        # the second pass.
        seen_values = set()
        deduped = []
        for f in findings:
            val_key = f['string'][:100]
            if val_key not in seen_values:
                seen_values.add(val_key)
                deduped.append(f)

        self.string_findings = deduped[:500]  # Limit per file
        # Publish to the shared context so post-loop consumers (notably the IOC
        # plumbing in workers.py) can scrape the decoded strings without
        # holding a reference to this extractor instance.
        self._context.decoded_strings = self.string_findings
        return self.string_findings

    def prepare_export_data(self, exporter_type: str) -> Any:
        if exporter_type == "ClickHouseExporter":
            if not self.string_findings:
                return None

            data = []
            for f in self.string_findings:
                data.append([
                    self.sha256,
                    f['string'],
                    f['string_raw'],
                    f['string_encoding'],
                    f['string_offset'],
                    f['string_length'],
                    f['string_raw_length'],
                    f['string_entropy'],
                ])

            column_names = [
                "sha256",
                "string",
                "string_raw",
                "string_encoding",
                "string_offset",
                "string_length",
                "string_raw_length",
                "string_entropy",
            ]

            column_type_names = [
                "FixedString(64)",
                "String",
                "String",
                "LowCardinality(String)",
                "UInt64",
                "UInt32",
                "UInt32",
                "Float32",
            ]

            return (data, column_names, column_type_names)

    def get_clickhouse_table(self) -> str:
        return "code_binja_strings_raw"