Xiaokun Wang

59 papers A* 5C 7Journal 36Unranked 10
YearRankTypeTitle / Venue / Authors
2026 J jnl
Appl. Intell.
Ruibin Wang, Abdul Rehman, Tingting Li, Rupert Page, Hailing Li, Xiaokun Wang, Xiaosong Yang, Jian Jun Zhang
2025 J jnl
Comput. Animat. Virtual Worlds
Qianwei Wang, Yanrui Xu, Xiangyu Sheng, Chao Yao, Yu Guo, Jian Chang, Jianjun Zhang, Xiaokun Wang
2025 J jnl
Comput. Animat. Virtual Worlds
Haokai Zeng, Dongyu Yang, Yanrui Xu, Yalan Zhang, Zhongmin Wang, Feng Tian, Xiaokun Wang, Xiaojuan Ban
2025 J jnl
Comput. Animat. Virtual Worlds
Yalan Zhang, Yuhang Xu, Xiaokun Wang, Angelos Chatzimparmpas, Xiaojuan Ban
2025 J jnl
IEEE Trans. Vis. Comput. Graph.
Xingyu Ye, Xiaokun Wang, Yanrui Xu, Alexandru C. Telea, Jirí Kosinka, Lihua You, Jian Jun Zhang, Jian Chang
2025 J jnl
IEEE Trans. Vis. Comput. Graph.
Xiangyang Zhou, Yanrui Xu, Chao Yao, Xiaokun Wang, Xiaojuan Ban
2025 J jnl
Proc. ACM Interact. Mob. Wearable Ubiquitous Technol.
Ang Cai, Chao Yao, Hongjun Liu, Changsheng Li, Yongyue Zhang, Yu Guo, Xiaokun Wang, Xiaojuan Ban
2025 A* conf
SIGGRAPH Asia
Ruolan Li, Yanrui Xu, Yalan Zhang, Jirí Kosinka, Alexandru C. Telea, Jian Chang, Jian Jun Zhang, Xiaojuan Ban, Xiaokun Wang
2025 J jnl
Comput. Graph.
Jiamin Wang, Haoping Wang, Xiaokun Wang, Yalan Zhang, Jirí Kosinka, Steffen Frey, Alexandru C. Telea, Xiaojuan Ban
2025 J jnl
Comput. Aided Geom. Des.
Yuanmu Xu, Guanli Hou, Jiangbei Hu, Tenglong Ren, Xiaokun Wang, Yalan Zhang, Xiaojuan Ban, Chen Qian, Fei Hou, Ying He
2025 A* conf
ACM Multimedia
Hongjun Liu, Chao Yao, Yalan Zhang, Xiaokun Wang, Xiaojuan Ban
2025 J jnl
CoRR
Hongjun Liu, Chao Yao, Yalan Zhang, Xiaokun Wang, Xiaojuan Ban
2024 J jnl
Vis. Comput.
Yuege Xiong, Xiaokun Wang, Yanrui Xu, Yalan Zhang, Jian Chang, Jian Jun Zhang, Xiaojuan Ban
2024 J jnl
Comput. Animat. Virtual Worlds
Xiangyang Zhou, Sinuo Liu, Haokai Zeng, Xiaokun Wang, Xiaojuan Ban
2024 ed.
CCCI
Mohammad S. Obaidat, Lin Zhang, Xiaokun Wang, Chao Yao, Kuei-Fang Hsiao, Petros Nicopolitidis, Yu Guo
2024 J jnl
Comput. Graph. Forum
Xingyu Ye, Xiaokun Wang, Yanrui Xu, Jirí Kosinka, Alexandru C. Telea, Lihua You, Jian Jun Zhang, Jian Chang
2024 J jnl
Comput. Graph. Forum
Yalan Zhang, S. Long, Yanrui Xu, Xiaokun Wang, Chao Yao, Jirí Kosinka, Steffen Frey, Alexandru C. Telea, Xiaojuan Ban
2024 J jnl
Comput. Animat. Virtual Worlds
Haoping Wang, Xiaokun Wang, Yanrui Xu, Yalan Zhang, Chao Yao, Yu Guo, Xiaojuan Ban
2024 J jnl
Comput. Vis. Media
Xiaokun Wang, Yanrui Xu, Sinuo Liu, Bo Ren, Jirí Kosinka, Alexandru C. Telea, Jiamin Wang, Chongming Song, Jian Chang, Chenfeng Li, Jian Jun Zhang, Xiaojuan Ban
2024 J jnl
Simul. Model. Pract. Theory
Yalan Zhang, Yuhang Xu, Yanrui Xu, Yue Hou, Xiaokun Wang, Yu Guo, Mohammad S. Obaidat, Xiaojuan Ban
2024 conf
CCCI
Song Fang, Jiamin Wang, Zirun Zhao, Chaopeng Wei, Xudong Zhang, Jiaxin Wang, Mohammad S. Obaidat, Xiaokun Wang
2024 conf
BIBM
Long Shen, Yalan Zhang, Steffen Frey, Alexandru C. Telea, Jirí Kosinka, Xiaokun Wang, Xiaojuan Ban
2024 A* conf
IJCAI
Jinsheng Sun, Chao Yao, Xiaokun Wang, Yu Guo, Yalan Zhang, Xiaojuan Ban
2023 A* conf
SIGGRAPH Asia
Yanrui Xu, Xiaokun Wang, Jiamin Wang, Chongming Song, Tiancheng Wang, Yalan Zhang, Jian Chang, Jian-Jun Zhang, Jirí Kosinka, Alexandru C. Telea, Xiaojuan Ban
2023 J jnl
Comput. Graph.
Yanrui Xu, Yuanmu Xu, Yuege Xiong, Dou Yin, Xiaojuan Ban, Xiaokun Wang, Jian Chang, Jian-Jun Zhang
2023 conf
VR Workshops
Sinuo Liu, Xiaojuan Ban, Sheng Li, Haokai Zeng, Xiaokun Wang, Yanrui Xu, Fei Zhu, Guoping Wang
2023 J jnl
Comput. Graph.
Jian Chang, Xiaokun Wang, Alexandru C. Telea, Jirí Kosinka, Feng Tian, Xiaojuan Ban, Jian-Jun Zhang
2023 J jnl
Comput. Animat. Virtual Worlds
Bing Han, Chao Yao, Xiaokun Wang, Jian Chang, Xiaojuan Ban
2023 J jnl
Comput. Animat. Virtual Worlds
Xiaokun Wang, Tiancheng Wang, Jiamin Wang, Yanrui Xu, Xiaojuan Ban, Houbin Huang, Zhihong Zhu, Jian Chang, Jian-Jun Zhang
2023 J jnl
IEEE Robotics Autom. Lett.
Yuanyan Xie, Yu Guo, Zhenqiang Mi, Xiaokun Wang, Yang Yang, Mohammad S. Obaidat
2023 J jnl
Comput. Animat. Virtual Worlds
Yanrui Xu, Chongming Song, Xiaokun Wang, Xiaojuan Ban, Jiamin Wang, Yalan Zhang, Jian Chang
2021 conf
BIBM
Chongming Song, Yanrui Xu, Xiaokun Wang, Jiamin Wang, Houbin Huang, Zhihong Zhu, Xiaojuan Ban
2021 conf
CCCI
Zihao Liu, Yanrui Xu, Xiaokun Wang, Xiaojuan Ban, Zhiyu Zheng
2021 J jnl
Comput. Graph. Forum
Sinuo Liu, Xiaokun Wang, Xiaojuan Ban, Yanrui Xu, Jing Zhou, Jirí Kosinka, Alexandru C. Telea
2020 conf
VR Workshops
Xiaokun Wang, Sinuo Liu, Xiaojuan Ban, Yanrui Xu, Jing Zhou, Jirí Kosinka
2020 J jnl
Vis. Comput.
Xiaokun Wang, Sinuo Liu, Xiaojuan Ban, Yanrui Xu, Jing Zhou, Jirí Kosinka
2020 J jnl
CoRR
Sinuo Liu, Xiaokun Wang, Xiaojuan Ban, Yanrui Xu, Jing Zhou, Jirí Kosinka, Alexandru C. Telea
2019 J jnl
Symmetry
Xiaokun Wang, Yanrui Xu, Xiaojuan Ban, Sinuo Liu, Yuting Xu
2019 conf
SIGGRAPH Posters
Xiaokun Wang, Sinuo Liu, Xiaojuan Ban, Yanrui Xu, Jing Zhou, Cong Wang
2019 conf
AsianCHI@CHI
Zhishuai Han, Xiaojuan Ban, Xiaokun Wang, Jianyu Wu
2019 conf
SIGGRAPH Asia Technical Briefs
Xiaokun Wang, Sinuo Liu, Xiaojuan Ban, Yanrui Xu, Jing Zhou, Cong Wang
2019 C conf
CDVE
Yanrui Xu, Xiaojuan Ban, Yan Peng, Xiaokun Wang, Sinuo Liu, Jing Zhou
2019 A* conf
VR
Sinuo Liu, Xiaokun Wang, Xiaojuan Ban, Yanrui Xu, Jing Zhou, Yalan Zhang
2018 J jnl
Symmetry
Sinuo Liu, Xiaojuan Ban, Ben Wang, Xiaokun Wang
2018 J jnl
Neural Comput. Appl.
Xiaojuan Ban, Xiaokun Wang, Liangliang He, Yalan Zhang, Lipeng Wang
2018 J jnl
Symmetry
Xiaokun Wang, Xiaojuan Ban, Runzi He, Di Wu, Xing Liu, Yuting Xu
2018 J jnl
CoRR
Zhishuai Han, Xiaojuan Ban, Xiaokun Wang, Di Wu
2018 J jnl
J. Vis. Lang. Comput.
Xiaokun Wang, Xiaojuan Ban, Sinuo Liu, Runzi He, Yuting Xu
2017 J jnl
Symmetry
Yalan Zhang, Xiaojuan Ban, Xiaokun Wang, Xing Liu
2017 C conf
CDVE
Xiaojuan Ban, Lipeng Wang, Xiaokun Wang, Yalan Zhang
2017 C conf
CW
Xiaokun Wang, Xiaojuan Ban, Yalan Zhang, Zhigeng Pan, Sinuo Liu
2017 J jnl
Sci. Program.
Xiaokun Wang, Xiaojuan Ban, Yalan Zhang, Xu Liu
2017 C conf
CDVE
Xu Liu, Pengfei Ye, Xiaojuan Ban, Xiaokun Wang
2017 J jnl
J. Comput. Sci. Technol.
Xiaokun Wang, Xiaojuan Ban, Yalan Zhang, Sinuo Liu, Pengfei Ye
2016 C conf
CDVE
Yalan Zhang, Xiaojuan Ban, Xiaokun Wang, Xing Liu
2016 C conf
CW
Yalan Zhang, Xiaojuan Ban, Xu Liu, Xiaokun Wang
2016 J jnl
J. Vis.
Xiaokun Wang, Xiaojuan Ban, Xu Liu, Yalan Zhang, Lipeng Wang
2016 C conf
CDVE
Xiaokun Wang, Xiaojuan Ban, Yalan Zhang, Xu Liu
2015 conf
Eurographics (Short Papers)
Liangliang He, Xiaojuan Ban, Xu Liu, Xiaokun Wang
redb/extractors/js_extractors/js_strings.py
← Index redb/extractors/js_extractors/js_strings.py python
import base64
import bisect
import inspect
import re
from datetime import datetime, timezone
from typing import Any

from redb.extractors.enum import Tag
from redb.extractors.js_extractor import JSExtractor
from redb.extractors.js_extractors.js_patterns import STRING_PATTERNS, line_offsets

# Local aliases for the compiled patterns this extractor uses. Defined and
# compiled exactly once in js_patterns.STRING_PATTERNS.
_HEX_STRING_RE = STRING_PATTERNS["hex_escape_seq"]
_UNICODE_STRING_RE = STRING_PATTERNS["unicode_escape_seq"]
_CHARCODE_RE = STRING_PATTERNS["charcode_call"]
_BASE64_STRING_RE = STRING_PATTERNS["base64_quoted"]
_CONCAT_STRING_RE = STRING_PATTERNS["concat_chain"]

# Tokeniser used inside _reconstruct_concat to pull each quoted part out of a
# matched concat chain. Compiled once at module load (was recompiled on every
# concat match before).
_CONCAT_TOKEN_RE = re.compile(r'["\']([^"\']*)["\']')


class JSStringsExtractor(JSExtractor):

    def __init__(
        self, filepath, log, exporters=None, index_prefix=None,
        known_benign=False, known_malicious=False, source=None, context=None,
    ):
        super().__init__(
            filepath, log, exporters, index_prefix,
            known_benign, known_malicious, source, context=context,
        )
        self.string_findings = None
        self.log.debug(inspect.currentframe().f_code.co_name)

    def tag(self):
        return Tag.JS_STRINGS.value

    def _decode_hex_string(self, hex_str):
        """Decode \\x41\\x42 style hex strings."""
        try:
            # Remove \\x prefix and decode
            clean = hex_str.replace('\\x', '')
            return bytes.fromhex(clean).decode('utf-8', errors='replace')
        except Exception:
            return None

    def _decode_unicode_string(self, uni_str):
        """Decode \\u0041\\u0042 style unicode strings."""
        try:
            return uni_str.encode('utf-8').decode('unicode_escape')
        except Exception:
            return None

    def _decode_charcode(self, charcode_str):
        """Decode String.fromCharCode(72, 101, 108, ...) sequences."""
        try:
            codes = [int(c.strip()) for c in charcode_str.split(',') if c.strip().isdigit()]
            return ''.join(chr(c) for c in codes if 0 <= c <= 0x10FFFF)
        except Exception:
            return None

    def _decode_base64(self, b64_str):
        """Attempt to decode base64 string."""
        try:
            decoded = base64.b64decode(b64_str)
            # Check if result is printable text
            text = decoded.decode('utf-8', errors='strict')
            # Only return if it looks like text (>80% printable)
            printable = sum(1 for c in text if c.isprintable() or c in '\n\r\t')
            if printable / len(text) > 0.8:
                return text
        except Exception:
            pass
        return None

    def _reconstruct_concat(self, concat_match):
        """Reconstruct concatenated string parts."""
        try:
            parts = _CONCAT_TOKEN_RE.findall(concat_match)
            return ''.join(parts)
        except Exception:
            return None

    def _find_line_number(self, match_start):
        """1-indexed line number for `match_start`, looked up in O(log L) via
        bisect over `self._line_offsets` (built once per extract() call).

        Replaces the historical `self.js_source[:match_start].count('\\n') + 1`
        which was O(N) per call and quadratic across all matches in a sample.
        """
        return bisect.bisect_right(self._line_offsets, match_start)

    def _scan_text(self, text):
        """Run every encoded-string pattern over `text` and return a list of
        finding dicts. Stateless apart from the per-call `_line_offsets` cache,
        which `_find_line_number` reads — callers must reset it before invoking
        this so line numbers reference the text being scanned, not the previous
        one.
        """
        findings = []

        # Hex-encoded strings
        for m in _HEX_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_hex_string(raw)
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'hex',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Unicode-encoded strings
        for m in _UNICODE_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_unicode_string(raw)
            if decoded and len(decoded) >= 3:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'unicode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # String.fromCharCode sequences
        for m in _CHARCODE_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_charcode(m.group(1))
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'charcode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Base64-encoded strings
        for m in _BASE64_STRING_RE.finditer(text):
            raw = m.group(0)
            b64_val = m.group(1)
            decoded = self._decode_base64(b64_val)
            if decoded and len(decoded) >= 10:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'base64',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Concatenated strings (reassembled)
        for m in _CONCAT_STRING_RE.finditer(text):
            raw = m.group()
            reconstructed = self._reconstruct_concat(raw)
            if reconstructed and len(reconstructed) >= 20:
                findings.append({
                    'string': reconstructed[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'concat',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(reconstructed),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(reconstructed),
                })

        return findings

    def extract(self):
        src = self.js_source
        if not src:
            return None

        # Pass 1: raw source. _line_offsets is keyed off whichever text is
        # currently being scanned so _find_line_number resolves to that text.
        self._line_offsets = line_offsets(src)
        findings = self._scan_text(src)

        # Pass 2: deobfuscated text, when the deobfuscator produced something
        # meaningfully different. Same patterns, but a different surface — for
        # samples where the encoded payload is hidden behind an outer wrapper
        # (e.g. array.join() + eval in Vjw0rm/WSH-RAT) only this pass yields
        # any rows at all.
        deobf_text, _ = self._context.deobfuscated
        if deobf_text and deobf_text != src:
            self._line_offsets = line_offsets(deobf_text)
            findings.extend(self._scan_text(deobf_text))

        if not findings:
            return None

        # Deduplicate by decoded string value (raw pass wins on collision: it
        # comes first in `findings`). A string that surfaces only in the
        # deobfuscated text still gets persisted, which is the whole point of
        # the second pass.
        seen_values = set()
        deduped = []
        for f in findings:
            val_key = f['string'][:100]
            if val_key not in seen_values:
                seen_values.add(val_key)
                deduped.append(f)

        self.string_findings = deduped[:500]  # Limit per file
        # Publish to the shared context so post-loop consumers (notably the IOC
        # plumbing in workers.py) can scrape the decoded strings without
        # holding a reference to this extractor instance.
        self._context.decoded_strings = self.string_findings
        return self.string_findings

    def prepare_export_data(self, exporter_type: str) -> Any:
        if exporter_type == "ClickHouseExporter":
            if not self.string_findings:
                return None

            data = []
            for f in self.string_findings:
                data.append([
                    self.sha256,
                    f['string'],
                    f['string_raw'],
                    f['string_encoding'],
                    f['string_offset'],
                    f['string_length'],
                    f['string_raw_length'],
                    f['string_entropy'],
                ])

            column_names = [
                "sha256",
                "string",
                "string_raw",
                "string_encoding",
                "string_offset",
                "string_length",
                "string_raw_length",
                "string_entropy",
            ]

            column_type_names = [
                "FixedString(64)",
                "String",
                "String",
                "LowCardinality(String)",
                "UInt64",
                "UInt32",
                "UInt32",
                "Float32",
            ]

            return (data, column_names, column_type_names)

    def get_clickhouse_table(self) -> str:
        return "code_binja_strings_raw"