Samuel Marks

According to our database¹, Samuel Marks authored at least 11 papers between 2023 and 2024.

Collaborative distances:

Dijkstra number² of four.
Erdős number³ of four.

Timeline

Legend:

Book

In proceedings

Article

PhD thesis

Dataset

Other

Links

On csauthors.net:

Bibliography

2024

Alignment faking in large language models.

[BibT_eX]

[DOI]

CoRR, 2024

Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks.

[BibT_eX]

[DOI]

CoRR, 2024

Erasing Conceptual Knowledge from Language Models.

[BibT_eX]

[DOI]

CoRR, 2024

The Quest for the Right Mediator: A History, Survey, and Theoretical Grounding of Causal Interpretability.

[BibT_eX]

[DOI]

Aruna Sankaranarayanan

CoRR, 2024

Measuring Progress in Dictionary Learning for Language Model Interpretability with Board Game Models.

[BibT_eX]

[DOI]

Claudio Mayrink Verdun

David Bau

Samuel Marks

CoRR, 2024

NNsight and NDIF: Democratizing Access to Foundation Model Internals.

[BibT_eX]

[DOI]

CoRR, 2024

Connecting the Dots: LLMs can Infer and Verbalize Latent Structure from Disparate Training Data.

[BibT_eX]

[DOI]

CoRR, 2024

Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models.

[BibT_eX]

[DOI]

CoRR, 2024

Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models.

[BibT_eX]

[DOI]

CoRR, 2024

2023

Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.

[BibT_eX]

[DOI]

Trans. Mach. Learn. Res., 2023

The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets.

[BibT_eX]

[DOI]

Samuel Marks

Max Tegmark

CoRR, 2023

Samuel Marks

Timeline

Legend:

Links

On csauthors.net:

Bibliography

Loading...