Ingrid Agartz

17 papers Journal 13Unranked 4
YearRankTypeTitle / Venue / Authors
2026 J jnl
Artif. Intell. Medicine
Michail Mamalakis, Héloïse de Vareilles, Atheer Al-Manea, Samantha C. Mitchell, Ingrid Agartz, Lynn Egeland Mørch-Johnsen, Jane R. Garrison, Jon S. Simons, Pietro Lio, John Suckling, Graham K. Murray
2025 conf
ShapeMI@MICCAI
Yanghee Im, Leila Nabulsi, Melody J. Y. Kang, Sophia I. Thomopoulos, Ana M. Diaz Zuluaga, Anders M. Dale, Andriana Karuk, Annabella Di Giorgio, Benson Mwangi, Boris Gutman, Bronwyn Overs, Carlos López Jaramillo, Colm McDonald, Dan J. Stein, Dara M. Cannon, David C. Glahn, Diego Hidalgo-Mazzei, Diliana Pecheva, Dominik Grotegerd, Edith Pomarol-Clotet, Eduard Vieta, Emilie Olie, Enric Vilajosana Chertó, Fabio Sambataro, Fleur Howells, Freda Scheffler, Geraldo Busatto, Gerard Anmella, Giovana B. Zunta-Soares, Gloria M. P. Roberts, Henk Temmingh, Ian H. Gotlib, Ingrid Agartz, Jair C. Soares, James A. Karantonis, James Prisciandaro, Janice M. Fullerton, Joaquim Radua, Jonathan Savitz, Josselin Houenou, Kang Sim, Kenichiro Harada, Klaus Berger, Koji Matsuo, Lakshmi Yatham, Lars Tjelta Westlye, Lisa Eyler, Lisa Furlong, Luisa Klahn, Marco Hermesdorf, Marcus V. Zanetti, Matthew Kempton, Matthew D. Sacchet, Mikael Landen, Mon-Ju Wu, Pedro Rosa, Philip Mitchell, Pravesh Parekh, Raymond Salvador, Rayus Kuplicki, Salvador Sarró, Susan Rossell, Tamsyn Van Rheenen, Theodore Satterthwaite, Tilo Kircher, Tomas Hajek, Udo Dannlowski, Xavier Caseras, Yuji Zhao, Ole A. Andreassen, Paul M. Thompson, Christopher R. K. Ching
2025 J jnl
AI Open
Michail Mamalakis, Antonios Mamalakis, Ingrid Agartz, Lynn Egeland Mørch-Johnsen, Graham K. Murray, John Suckling, Pietro Lio
2024 J jnl
CoRR
Michail Mamalakis, Héloïse de Vareilles, Shun-Chin Jim Wu, Ingrid Agartz, Lynn Egeland Mørch-Johnsen, Jane R. Garrison, Jon S. Simons, Pietro Lio, John Suckling, Graham K. Murray
2024 J jnl
CoRR
Michail Mamalakis, Antonios Mamalakis, Ingrid Agartz, Lynn Egeland Mørch-Johnsen, Graham K. Murray, John Suckling, Pietro Lio
2023 J jnl
CoRR
Michail Mamalakis, Héloïse de Vareilles, Atheer AI-Manea, Samantha C. Mitchell, Ingrid Agartz, Lynn Egeland Morch-Johnsen, Jane R. Garrison, Jon S. Simons, Pietro Lio, John Suckling, Graham K. Murray
2022 J jnl
NeuroImage
Esten H. Leonardsen, Han Peng, Tobias Kaufmann, Ingrid Agartz, Ole A. Andreassen, Elisabeth Gulowsen Celius, Thomas Espeseth, Hanne F. Harbo, Einar A. Høgestøl, Ann-Marie G. de Lange, Andre F. Marquand, Dídac Vidal-Piñeiro, James M. Roe, Geir Selbæk, Øystein Sørensen, Stephen M. Smith, Lars T. Westlye, Thomas Wolfers, Yunpeng Wang
2021 J jnl
NeuroImage
Stener Nerland, Kjetil N. Jørgensen, Wibeke Nordhøy, Ivan I. Maximov, Robin A. B. Bugge, Lars T. Westlye, Ole A. Andreassen, Oliver M. Geier, Ingrid Agartz
2020 J jnl
IEEE Trans. Biomed. Eng.
Md Abdur Rahaman, Daniel H. Mathalon, Hyo Jong Lee, Wenhao Jiang, Bryon A. Mueller, Ole A. Andreassen, Ingrid Agartz, Scott R. Sponheim, Andrew R. Mayer, Julia M. Stephen, Rex E. Jung, Jessica A. Turner, José M. Cañive, Juan R. Bustillo, Vince D. Calhoun, Cota Navin Gupta, Srinivas Rachakonda, Jiayu Chen, Jingyu Liu, Theo G. M. van Erp, Steven G. Potkin, Judith M. Ford
2017 J jnl
NeuroImage
Nhat Trung Doan, Andreas Engvig, Krystal Zaske, Karin Persson, Martina Jonette Lund, Tobias Kaufmann, Aldo Córdova-Palomera, Dag Alnæs, Torgeir Moberget, Anne Brækhus, Laura Barca, Jan Egil Nordvik, Knut Engedal, Ingrid Agartz, Geir Selbæk, Ole A. Andreassen, Lars T. Westlye
2017 J jnl
NeuroImage
Tobias Kaufmann, Dag Alnæs, Christine Lycke Brandt, Nhat Trung Doan, Karolina Kauppi, Francesco Bettella, Trine V. Lagerberg, Akiah O. Berg, Srdjan Djurovic, Ingrid Agartz, Ingrid Melle, Torill Ueland, Ole A. Andreassen, Lars T. Westlye
2013 conf
MICCAI (2)
Derrek P. Hibar, Sarah E. Medland, Jason L. Stein, Sungeun Kim, Li Shen, Andrew J. Saykin, Greig I. de Zubicaray, Katie McMahon, Grant W. Montgomery, Nicholas G. Martin, Margaret J. Wright, Srdjan Djurovic, Ingrid Agartz, Ole A. Andreassen, Paul M. Thompson
2013 J jnl
NeuroImage
Morten Mattingsdal, Andrew Anand Brown, Srdjan Djurovic, Ida Elken Sønderby, Andres Server, Ingrid Melle, Ingrid Agartz, Eivind Hovig, Jimmy Jensen, Ole A. Andreassen
2009 J jnl
NeuroImage
Lars T. Westlye, Kristine B. Walhovd, Anders M. Dale, Thomas Espeseth, Ivar Reinvang, Naftali Raz, Ingrid Agartz, Douglas N. Greve, Bruce Fischl, Anders M. Fjell
2009 J jnl
NeuroImage
Glenn Lawyer, Egil Ferkingstad, Ragnar Nesvåg, Katarina Varnäs, Ingrid Agartz
2005 conf
SCIA
Roger Hult, Ingrid Agartz
2002 conf
PKDD
Stefan Arnborg, Ingrid Agartz, Håkan Hall, Erik Jönsson, Anna Sillén, Göran Sedvall
redb/extractors/js_extractors/js_strings.py
← Index redb/extractors/js_extractors/js_strings.py python
import base64
import bisect
import inspect
import re
from datetime import datetime, timezone
from typing import Any

from redb.extractors.enum import Tag
from redb.extractors.js_extractor import JSExtractor
from redb.extractors.js_extractors.js_patterns import STRING_PATTERNS, line_offsets

# Local aliases for the compiled patterns this extractor uses. Defined and
# compiled exactly once in js_patterns.STRING_PATTERNS.
_HEX_STRING_RE = STRING_PATTERNS["hex_escape_seq"]
_UNICODE_STRING_RE = STRING_PATTERNS["unicode_escape_seq"]
_CHARCODE_RE = STRING_PATTERNS["charcode_call"]
_BASE64_STRING_RE = STRING_PATTERNS["base64_quoted"]
_CONCAT_STRING_RE = STRING_PATTERNS["concat_chain"]

# Tokeniser used inside _reconstruct_concat to pull each quoted part out of a
# matched concat chain. Compiled once at module load (was recompiled on every
# concat match before).
_CONCAT_TOKEN_RE = re.compile(r'["\']([^"\']*)["\']')


class JSStringsExtractor(JSExtractor):

    def __init__(
        self, filepath, log, exporters=None, index_prefix=None,
        known_benign=False, known_malicious=False, source=None, context=None,
    ):
        super().__init__(
            filepath, log, exporters, index_prefix,
            known_benign, known_malicious, source, context=context,
        )
        self.string_findings = None
        self.log.debug(inspect.currentframe().f_code.co_name)

    def tag(self):
        return Tag.JS_STRINGS.value

    def _decode_hex_string(self, hex_str):
        """Decode \\x41\\x42 style hex strings."""
        try:
            # Remove \\x prefix and decode
            clean = hex_str.replace('\\x', '')
            return bytes.fromhex(clean).decode('utf-8', errors='replace')
        except Exception:
            return None

    def _decode_unicode_string(self, uni_str):
        """Decode \\u0041\\u0042 style unicode strings."""
        try:
            return uni_str.encode('utf-8').decode('unicode_escape')
        except Exception:
            return None

    def _decode_charcode(self, charcode_str):
        """Decode String.fromCharCode(72, 101, 108, ...) sequences."""
        try:
            codes = [int(c.strip()) for c in charcode_str.split(',') if c.strip().isdigit()]
            return ''.join(chr(c) for c in codes if 0 <= c <= 0x10FFFF)
        except Exception:
            return None

    def _decode_base64(self, b64_str):
        """Attempt to decode base64 string."""
        try:
            decoded = base64.b64decode(b64_str)
            # Check if result is printable text
            text = decoded.decode('utf-8', errors='strict')
            # Only return if it looks like text (>80% printable)
            printable = sum(1 for c in text if c.isprintable() or c in '\n\r\t')
            if printable / len(text) > 0.8:
                return text
        except Exception:
            pass
        return None

    def _reconstruct_concat(self, concat_match):
        """Reconstruct concatenated string parts."""
        try:
            parts = _CONCAT_TOKEN_RE.findall(concat_match)
            return ''.join(parts)
        except Exception:
            return None

    def _find_line_number(self, match_start):
        """1-indexed line number for `match_start`, looked up in O(log L) via
        bisect over `self._line_offsets` (built once per extract() call).

        Replaces the historical `self.js_source[:match_start].count('\\n') + 1`
        which was O(N) per call and quadratic across all matches in a sample.
        """
        return bisect.bisect_right(self._line_offsets, match_start)

    def _scan_text(self, text):
        """Run every encoded-string pattern over `text` and return a list of
        finding dicts. Stateless apart from the per-call `_line_offsets` cache,
        which `_find_line_number` reads — callers must reset it before invoking
        this so line numbers reference the text being scanned, not the previous
        one.
        """
        findings = []

        # Hex-encoded strings
        for m in _HEX_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_hex_string(raw)
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'hex',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Unicode-encoded strings
        for m in _UNICODE_STRING_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_unicode_string(raw)
            if decoded and len(decoded) >= 3:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'unicode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # String.fromCharCode sequences
        for m in _CHARCODE_RE.finditer(text):
            raw = m.group()
            decoded = self._decode_charcode(m.group(1))
            if decoded and len(decoded) >= 4:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'charcode',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Base64-encoded strings
        for m in _BASE64_STRING_RE.finditer(text):
            raw = m.group(0)
            b64_val = m.group(1)
            decoded = self._decode_base64(b64_val)
            if decoded and len(decoded) >= 10:
                findings.append({
                    'string': decoded[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'base64',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(decoded),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(decoded),
                })

        # Concatenated strings (reassembled)
        for m in _CONCAT_STRING_RE.finditer(text):
            raw = m.group()
            reconstructed = self._reconstruct_concat(raw)
            if reconstructed and len(reconstructed) >= 20:
                findings.append({
                    'string': reconstructed[:4000],
                    'string_raw': raw[:4000],
                    'string_encoding': 'concat',
                    'string_offset': self._find_line_number(m.start()),
                    'string_length': len(reconstructed),
                    'string_raw_length': len(raw),
                    'string_entropy': self._calculate_text_entropy(reconstructed),
                })

        return findings

    def extract(self):
        src = self.js_source
        if not src:
            return None

        # Pass 1: raw source. _line_offsets is keyed off whichever text is
        # currently being scanned so _find_line_number resolves to that text.
        self._line_offsets = line_offsets(src)
        findings = self._scan_text(src)

        # Pass 2: deobfuscated text, when the deobfuscator produced something
        # meaningfully different. Same patterns, but a different surface — for
        # samples where the encoded payload is hidden behind an outer wrapper
        # (e.g. array.join() + eval in Vjw0rm/WSH-RAT) only this pass yields
        # any rows at all.
        deobf_text, _ = self._context.deobfuscated
        if deobf_text and deobf_text != src:
            self._line_offsets = line_offsets(deobf_text)
            findings.extend(self._scan_text(deobf_text))

        if not findings:
            return None

        # Deduplicate by decoded string value (raw pass wins on collision: it
        # comes first in `findings`). A string that surfaces only in the
        # deobfuscated text still gets persisted, which is the whole point of
        # the second pass.
        seen_values = set()
        deduped = []
        for f in findings:
            val_key = f['string'][:100]
            if val_key not in seen_values:
                seen_values.add(val_key)
                deduped.append(f)

        self.string_findings = deduped[:500]  # Limit per file
        # Publish to the shared context so post-loop consumers (notably the IOC
        # plumbing in workers.py) can scrape the decoded strings without
        # holding a reference to this extractor instance.
        self._context.decoded_strings = self.string_findings
        return self.string_findings

    def prepare_export_data(self, exporter_type: str) -> Any:
        if exporter_type == "ClickHouseExporter":
            if not self.string_findings:
                return None

            data = []
            for f in self.string_findings:
                data.append([
                    self.sha256,
                    f['string'],
                    f['string_raw'],
                    f['string_encoding'],
                    f['string_offset'],
                    f['string_length'],
                    f['string_raw_length'],
                    f['string_entropy'],
                ])

            column_names = [
                "sha256",
                "string",
                "string_raw",
                "string_encoding",
                "string_offset",
                "string_length",
                "string_raw_length",
                "string_entropy",
            ]

            column_type_names = [
                "FixedString(64)",
                "String",
                "String",
                "LowCardinality(String)",
                "UInt64",
                "UInt32",
                "UInt32",
                "Float32",
            ]

            return (data, column_names, column_type_names)

    def get_clickhouse_table(self) -> str:
        return "code_binja_strings_raw"