Wei Yue

33 papers A* 2B 1C 1Journal 22Unranked 7
YearRankTypeTitle / Venue / Authors
2026 J jnl
J. Supercomput.
Yue Han, Wei Yue, Bin Yang
2026 conf
CHI Extended Abstracts
Lei Hong, Wei Yue, I-Chin Chen, Chun-Cheng Hsu
2025 J jnl
CoRR
Yulin Sun, Xiaopeng Si, Runnan He, Xiao Hu, Peter Smielewski, Wenlong Wang, Xiaoguang Tong, Wei Yue, Meijun Pang, Kuo Zhang, Xizi Song, Dong Ming, Xiuyun Liu
2025 J jnl
npj Digit. Medicine
Yulin Sun, Xiaopeng Si, Runnan He, Xiao Hu, Peter Smielewski, Wenlong Wang, Xiaoguang Tong, Wei Yue, Meijun Pang, Kuo Zhang, Xizi Song, Dong Ming, Xiuyun Liu
2025 A* conf
UIST
Tianyu Yu, Peisheng He, Bob Tianqi Wei, Chenyuheng Wang, Xueqing Li, Xuezhu Wang, Yao Lu, Wei Yue, Megan Teng, Zihan Wang, Liwei Lin, Haipeng Mi, Qi Lu, Lining Yao
2024 conf
HCI (58)
Yudan Shen, Zhihong Wu, Xiawei Fang, Wei Yue
2024 J jnl
Comput. Electron. Agric.
Bin Sun, Pengyao Qin, Wei Yue, Ye Guo, Zhihai Gao, Yan Wang, Yifu Li, Ziyu Yan
2024 J jnl
Int. J. Appl. Earth Obs. Geoinformation
Bin Sun, Rong Rong, Hanwen Cui, Ye Guo, Wei Yue, Ziyu Yan, Han Wang, Zhihai Gao, Zhitao Wu
2024 J jnl
Geo spatial Inf. Sci.
Bin Sun, Pengyao Qin, Changlong Li, Zhihai Gao, Alan Grainger, Xiaosong Li, Yan Wang, Wei Yue
2024 J jnl
J. Intell. Fuzzy Syst.
Bing Wang, Wei Yue, Lu Zhang
2023 conf
HCI (8)
Tianxiong Wang, Wei Yue, Liu Yang, Xian Gao, Tong Yu, Qiang Yu
2023 conf
PRCV (1)
Wei Yue
2023 J jnl
Neural Networks
Ming Yang, Jiang Wang, Shanshan Li, Kuanchuan Wang, Wei Yue, Chen Liu
2023 J jnl
Syst.
Yuqian Yang, Maolin Yang, Siwei Shangguan, Yifan Cao, Wei Yue, Kaiqiang Cheng, Pingyu Jiang
2023 conf
BIBM
Bo Lin, Jing Wang, Yunfei Dou, Yuquan Zhang, Wei Yue, Gang Yu, Jianwei Yin
2023 J jnl
Remote. Sens.
Zhengyong Xu, Bin Sun, Wangfei Zhang, Zhihai Gao, Wei Yue, Han Wang, Zhitao Wu, Sihan Teng
2023 J jnl
Comput. Hum. Behav.
Yu Tian, Wu Li, Jianglong Guo, Wei Yue, Peipei Chen, Yanfang Li
2023 J jnl
IEEE Trans. Instrum. Meas.
Jia-Kang Wu, Wei Yue, Ke Gao, Svetlana von Gratowski, Xiao-Feng Gu, Lijia Pan, Nam-Young Kim, Jun-Ge Liang
2022 J jnl
Remote. Sens.
Yupeng Chen, Jinguang Lv, Wei Yue, Yuanhang Zhao, Yuxin Qin, Jin Tao, Cheng Chen, Weibiao Wang, Jingqiu Liang
2022 B conf
ICPADS
Feng Wang, Gongming Zhao, Qianyu Zhang, Hongli Xu, Wei Yue, Liguang Xie
2022 J jnl
Remote. Sens.
Wei Yue, Li Jiang, Xiubin Yang, Suining Gao, Yunqiang Xie, Tingting Xu
2021 conf
HCI (9)
Ke Wang, Yi-Hsuan Li, Chun-Chen Hsu, Jiabei Jiang, Yan Liu, Zirui Zhao, Wei Yue, Lu Yao
2021 J jnl
IEEE Access
Tingting Xu, Xiubin Yang, Shaoen Wang, Jinliang Han, Lin Chang, Wei Yue
2021 J jnl
IEEE J. Sel. Top. Appl. Earth Obs. Remote. Sens.
Jinliang Han, Xiubin Yang, Wei Yue, Tingting Xu, Shaoen Wang, Lin Chang, Chunlei Yang
2020 J jnl
J. Comput. Biol.
Zhenan Zhang, Yuqin Liu, Wei Wang, Yue Xing, Nanyang Jiang, Hongrui Zhang, Hanwen Zhang, Lei He, Wei Yue, Lianju Jiang, Kaili Wang
2020 J jnl
IEEE Access
Tingting Xu, Xiubin Yang, Shaoen Wang, Jinliang Han, Lin Chang, Wei Yue
2019 J jnl
Microelectron. J.
Zhaozhao Xu, Donghua Liu, Jun Hu, Feng Jin, Xinjie Yang, Wenting Duan, Wei Yue, Ziquan Fang, Wensheng Qian, Weiran Kong, Shichang Zou
2018 conf
IIH-MSP (1)
Xiaoli Guo, Ping Guo, Li Feng, Wei Yue
2016 J jnl
Intell. Autom. Soft Comput.
Hongyong Jia, Yue Chen, Julong Lan, Wei Yue, Zhiwei Wang
2013 J jnl
J. Appl. Math.
Xiaohong Chen, Li Yang, Pei Wang, Wei Yue
2012 J jnl
J. Appl. Math.
Shichang Ma, Yufeng Xu, Wei Yue
2006 C conf
ACC
Wei Yue, Luis Rodrigues, Brandon Gordon
1999 A* conf
INFOCOM
Theodore Faber, Joseph D. Touch, Wei Yue
redb/extractors/js_extractors/js_strings.py
← Index redb/extractors/js_extractors/js_strings.py python
import base64
import bisect
import inspect
import re
from datetime import datetime, timezone
from typing import Any

from redb.extractors.enum import Tag
from redb.extractors.js_extractor import JSExtractor
from redb.extractors.js_extractors.js_patterns import STRING_PATTERNS, line_offsets

# Local aliases for the compiled patterns this extractor uses. Defined and
# compiled exactly once in js_patterns.STRING_PATTERNS.
_HEX_STRING_RE = STRING_PATTERNS["hex_escape_seq"]
_UNICODE_STRING_RE = STRING_PATTERNS["unicode_escape_seq"]
_CHARCODE_RE = STRING_PATTERNS["charcode_call"]
_BASE64_STRING_RE = STRING_PATTERNS["base64_quoted"]
_CONCAT_STRING_RE = STRING_PATTERNS["concat_chain"]

# Tokeniser used inside _reconstruct_concat to pull each quoted part out of a
# matched concat chain. Compiled once at module load (was recompiled on every
# concat match before).
_CONCAT_TOKEN_RE = re.compile(r'["\']([^"\']*)["\']')


class JSStringsExtractor(JSExtractor):

    def __init__(
        self, filepath, log, exporters=None, index_prefix=None,
        known_benign=False, known_malicious=False, source=None, context=None,
    ):
        super().__init__(
            filepath, log, exporters, index_prefix,
            known_benign, known_malicious, source, context=context,
        )
        self.string_findings = None
        self.log.debug(inspect.currentframe().f_code.co_name)

    def tag(self):
        return Tag.JS_STRINGS.value

    def _decode_hex_string(self, hex_str):
        """Decode \\x41\\x42 style hex strings."""
        try:
            # Remove \\x prefix and decode
            clean = hex_str.replace('\\x', '')
            return bytes.fromhex(clean).decode('utf-8', errors='replace')
        except Exception:
            return None

    def _decode_unicode_string(self, uni_str):
        """Decode \\u0041\\u0042 style unicode strings."""
        try:
            return uni_str.encode('utf-8').decode('unicode_escape')
        except Exception:
            return None

    def _decode_charcode(self, charcode_str):
        """Decode String.fromCharCode(72, 101, 108, ...) sequences."""
        try:
            codes = [int(c.strip()) for c in charcode_str.split(',') if c.strip().isdigit()]
            return ''.join(chr(c) for c in codes if 0 <= c <= 0x10FFFF)
        except Exception:
            return None

    def _decode_base64(self, b64_str):
        """Attempt to decode base64 string."""
        try:
            decoded = base64.b64decode(b64_str)
            # Check if result is printable text
            text = decoded.decode('utf-8', errors='strict')
            # Only return if it looks like text (>80% printable)
            printable = sum(1 for c in text if c.isprintable() or c in '\n\r\t')
            if printable / len(text) > 0.8:
                return text
        except Exception:
            pass
        return None

    def _reconstruct_concat(self, concat_match):
        """Reconstruct concatenated string parts."""
        try:
            parts = _CONCAT_TOKEN_RE.findall(concat_match)
            return ''.join(parts)
        except Exception:
            return None

    def _find_line_number(self, match_start):
        """1-indexed line number for `match_start`, looked up in O(log L) via
        bisect over `self._line_offsets` (built once per extract() call).

        Replaces the historical `self.js_source[:match_start].count('\\n') + 1`
        which was O(N) per call and quadratic across all matches in a sample.
        """
        return bisect.bisect_right(self._line_offsets, match_start)

    def _scan_text(self, text):
        """Run every encoded-string pattern over `text` and return a list of
        finding dicts. Stateless apart from the per-call `_line_offsets` cache,
        which `_find_line_number` reads — callers must reset it before invoking
        this so line numbers reference the text being scanned, not the previous
        one.
        """
        findings = []

        # Hex-encoded strings
        for m in _HEX_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_hex_string(raw)
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'hex',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Unicode-encoded strings
        for m in _UNICODE_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_unicode_string(raw)
            if decoded and len(decoded) >= 3:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'unicode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # String.fromCharCode sequences
        for m in _CHARCODE_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_charcode(m.group(1))
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'charcode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Base64-encoded strings
        for m in _BASE64_STRING_RE.finditer(text):
            raw = m.group(0)
            b64_val = m.group(1)
            decoded = self._decode_base64(b64_val)
            if decoded and len(decoded) >= 10:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'base64',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Concatenated strings (reassembled)
        for m in _CONCAT_STRING_RE.finditer(text):
            raw = m.group()
            reconstructed = self._reconstruct_concat(raw)
            if reconstructed and len(reconstructed) >= 20:
                findings.append({
                    'string': reconstructed[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'concat',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(reconstructed),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(reconstructed),
                })

        return findings

    def extract(self):
        src = self.js_source
        if not src:
            return None

        # Pass 1: raw source. _line_offsets is keyed off whichever text is
        # currently being scanned so _find_line_number resolves to that text.
        self._line_offsets = line_offsets(src)
        findings = self._scan_text(src)

        # Pass 2: deobfuscated text, when the deobfuscator produced something
        # meaningfully different. Same patterns, but a different surface — for
        # samples where the encoded payload is hidden behind an outer wrapper
        # (e.g. array.join() + eval in Vjw0rm/WSH-RAT) only this pass yields
        # any rows at all.
        deobf_text, _ = self._context.deobfuscated
        if deobf_text and deobf_text != src:
            self._line_offsets = line_offsets(deobf_text)
            findings.extend(self._scan_text(deobf_text))

        if not findings:
            return None

        # Deduplicate by decoded string value (raw pass wins on collision: it
        # comes first in `findings`). A string that surfaces only in the
        # deobfuscated text still gets persisted, which is the whole point of
        # the second pass.
        seen_values = set()
        deduped = []
        for f in findings:
            val_key = f['string'][:100]
            if val_key not in seen_values:
                seen_values.add(val_key)
                deduped.append(f)

        self.string_findings = deduped[:500]  # Limit per file
        # Publish to the shared context so post-loop consumers (notably the IOC
        # plumbing in workers.py) can scrape the decoded strings without
        # holding a reference to this extractor instance.
        self._context.decoded_strings = self.string_findings
        return self.string_findings

    def prepare_export_data(self, exporter_type: str) -> Any:
        if exporter_type == "ClickHouseExporter":
            if not self.string_findings:
                return None

            data = []
            for f in self.string_findings:
                data.append([
                    self.sha256,
                    f['string'],
                    f['string_raw'],
                    f['string_encoding'],
                    f['string_offset'],
                    f['string_length'],
                    f['string_raw_length'],
                    f['string_entropy'],
                ])

            column_names = [
                "sha256",
                "string",
                "string_raw",
                "string_encoding",
                "string_offset",
                "string_length",
                "string_raw_length",
                "string_entropy",
            ]

            column_type_names = [
                "FixedString(64)",
                "String",
                "String",
                "LowCardinality(String)",
                "UInt64",
                "UInt32",
                "UInt32",
                "Float32",
            ]

            return (data, column_names, column_type_names)

    def get_clickhouse_table(self) -> str:
        return "code_binja_strings_raw"